AWS Glue Crawler开启仅爬取新文件夹定时运行报Internal Service Exception错误
排查与解决步骤
- 检查爬取路径下是否存在大量临时隐藏文件/文件夹(前缀为
.或_)Crawl new folders only模式下的定时调度爬取,会优先扫描指定时间窗口内新增的前缀,若窗口内存在大量无有效数据的隐藏临时文件(例如Spark作业生成的_SUCCESS、S3同步工具的临时分片文件、.__pycache__文件夹等),会触发Glue内部的前缀校验异常。你可以在S3路径配置中添加排除规则,过滤_*、.*前缀的路径。 - 核对爬取器的基准时间戳状态
定时触发的增量爬取默认以上一次成功运行的结束时间作为时间窗口起点,若爬取器曾经有过被手动终止、运行超时的记录,可能导致内部存储的基准时间戳异常。你可以通过以下操作重置:进入Glue控制台,找到对应爬取器,点击「操作」-「重置爬取器状态」,重置后等待下一次定时触发验证。
- 验证S3对象的LastModified时间连续性
如果你桶内的文件是从其他存储桶复制/迁移过来的,部分文件的LastModified时间可能早于爬取器首次运行的时间,定时增量爬取在做时间范围比对时可能出现逻辑异常。你可以在爬取器配置中开启「为S3路径使用对象创建时间而非最后修改时间」的选项。 - 调整爬取器的并发配置
定时触发的爬取默认分配的资源配额低于按需手动触发的配额,若你的S3桶下前缀数量超过10万,需要在爬取器配置的「安全配置」中调整并发数到5-10,避免资源不足触发内部异常。
内容的提问来源于stack exchange,提问作者Bokambo
相关产品推荐
相关产品推荐

