AWS Glue Crawler异常:多表生成与排除规则失效求助
解决AWS Glue Crawler排除规则失效与多表生成问题
排查排除规则格式问题
- 替换原排除规则
*/Supporting Documents/*为**/Supporting Documents/**,**可匹配任意层级目录,确保覆盖该目录下所有子路径的非Parquet文件,避免因空格或通配符匹配逻辑导致规则失效。 - 将后缀排除规则
**/*.csv、**/*.pdf、**/*.xlsx移至排除规则列表最前端,避免目录规则优先级冲突导致后缀过滤不生效。
修正"每个S3路径创建单一模式"的配置逻辑
- 确保所有
data_*_*_*.snappy.parquet文件集中存放在同一根路径下(如s3://your-bucket/parquet-root/),若文件分散在不同子目录,Crawler会识别为独立路径,生成多张表。 - 直接将Crawler的包含路径指定为Parquet文件所在的根目录,而非包含
Supporting Documents的父路径,从根源减少非目标文件的扫描范围。
处理Parquet文件报错的额外措施
- 用AWS CLI验证报错文件的有效性:执行命令
aws s3 cp s3://your-bucket/path/to/MYFILEBLAH - | parquet-tools head,检查文件是否损坏或格式异常。 - 删除Crawler之前生成的所有相关表与分区,清空旧元数据后重新运行Crawler,避免历史数据干扰新的模式生成。
其他关键配置检查
- 在Crawler的分类器设置中,将Parquet分类器优先级调至CSV、Excel等分类器之前,防止非Parquet文件被错误识别为Parquet格式。
- 确认Crawler的输出数据库唯一,避免与其他Crawler的元数据产生混淆。
内容的提问来源于stack exchange,提问作者mr-sk
相关产品推荐
相关产品推荐

