AWS Glue Crawler配置排除模式后仍添加被排除分区如何解决
Glue Crawler默认的排除模式逻辑仅作用于文件内容扫描环节:配置**.csv只会让爬虫跳过csv文件的Schema解析、不会因为csv格式与parquet不一致创建独立表,但不会影响目录遍历阶段的分区注册逻辑。
爬虫在遍历S3路径时,只要识别到符合Hive分区命名规则(分区键=值格式)的子目录,就会默认将其挂载到匹配到的主表下、直接继承主表Schema,不会校验应用排除规则后该目录下是否存在可爬取的有效文件——这就是全是csv文件的partition=C被错误注册为分区的核心原因。
按配置成本从低到高排序:
方案1:开启原生空分区排除开关(推荐)
Glue已提供原生配置解决该问题,无需调整排除规则或写自定义代码:
- 进入对应Glue Crawler的编辑页面
- 找到「输出配置(Output options)」板块
- 勾选 排除应用排除规则后无有效文件的分区(Exclude partitions with no eligible files after applying exclusion patterns) 选项
- 保存配置后重新运行爬虫即可
开启后爬虫在注册分区前会做校验:如果分区路径下所有文件都被排除规则匹配、没有可爬取的目标格式文件,会直接跳过该分区的注册,完全符合预期。
方案2:调整排除规则直接匹配整个分区目录
如果你的Glue版本暂不支持上述开关,且需要排除的分区有明确的命名规则,可以把排除规则从匹配文件后缀改为匹配整个分区目录,让爬虫直接跳过对应目录的遍历,从目录扫描阶段就忽略相关路径,自然不会注册无效分区:
- 固定分区排除:比如确定要排除
partition=C,直接把排除规则配置为**/partition=C/**即可 - 规则化分区排除:如果所有存csv的分区都有统一命名特征(比如分区名带
_csv后缀),可以对应写通配规则匹配整个目录
注意:Glue Crawler的排除通配符仅支持路径字符串匹配,无法基于目录下的文件类型做反向判断,如果你无法提前预知哪些分区存了csv,该方案不适用。
方案3:添加爬虫后置处理逻辑
如果既没有原生开关、要排除的分区也没有固定命名规则,可以给Crawler配置后置触发逻辑:
- 给Crawler绑定运行完成后触发的Lambda函数
- 函数逻辑为:爬取完成后调用Glue API拉取目标表的所有分区
- 逐个检查分区对应的S3路径:遍历路径下的文件,应用配置的排除规则(比如过滤掉所有.csv后缀文件),如果剩余有效文件数为0,就调用Glue的删除分区接口移除该无效分区
该方案灵活性最高,可兼容各种自定义排除逻辑,但需要维护少量自定义代码。
方案4:调整S3路径结构(根源规避)
最稳妥的长期方案是不要把不同存储格式的文件放在同一张Hive分区表的同级分区目录下:将csv格式的文件整体迁移到独立的S3前缀路径(比如s3://my_bucket/path_to_crawl_csv/),和parquet格式的爬取路径完全隔离,从根源上避免爬虫误识别分区。
不要开启爬虫配置里的「为每个S3路径创建单一Schema」选项,该选项会强制同一路径下的所有文件(哪怕被排除规则匹配)共用主表Schema,会进一步放大分区Schema不匹配的查询报错问题。
内容的提问来源于stack exchange,提问作者Aurimas Griciūnas

