You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AWS Glue Crawler异常:多表生成与排除规则失效求助

解决AWS Glue Crawler排除规则失效与多表生成问题

排查排除规则格式问题

  • 替换原排除规则*/Supporting Documents/*为**/Supporting Documents/**,**可匹配任意层级目录,确保覆盖该目录下所有子路径的非Parquet文件,避免因空格或通配符匹配逻辑导致规则失效。
  • 将后缀排除规则**/*.csv、**/*.pdf、**/*.xlsx移至排除规则列表最前端,避免目录规则优先级冲突导致后缀过滤不生效。

修正"每个S3路径创建单一模式"的配置逻辑

  • 确保所有data_*_*_*.snappy.parquet文件集中存放在同一根路径下(如s3://your-bucket/parquet-root/),若文件分散在不同子目录,Crawler会识别为独立路径,生成多张表。
  • 直接将Crawler的包含路径指定为Parquet文件所在的根目录,而非包含Supporting Documents的父路径,从根源减少非目标文件的扫描范围。

处理Parquet文件报错的额外措施

  • 用AWS CLI验证报错文件的有效性:执行命令 aws s3 cp s3://your-bucket/path/to/MYFILEBLAH - | parquet-tools head,检查文件是否损坏或格式异常。
  • 删除Crawler之前生成的所有相关表与分区,清空旧元数据后重新运行Crawler,避免历史数据干扰新的模式生成。

其他关键配置检查

  • 在Crawler的分类器设置中,将Parquet分类器优先级调至CSV、Excel等分类器之前,防止非Parquet文件被错误识别为Parquet格式。
  • 确认Crawler的输出数据库唯一,避免与其他Crawler的元数据产生混淆。

内容的提问来源于stack exchange,提问作者mr-sk

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.30 00:12:50