AWS Glue Crawler爬取CSV无法识别首行列头 配置Classifier仍失效怎么办
AWS Glue Crawler CSV表头识别失败的遗漏配置排查项
- 检查自定义CSV分类器是否已绑定到目标爬虫,且在爬虫的分类器列表中优先级排在最前:Glue爬虫会按分类器的排列顺序依次尝试匹配,自定义分类器优先级高于内置分类器的前提是你主动将其添加到爬虫的配置中
- 确认CSV分类器的参数和实际文件格式匹配:
- 分隔符设置和CSV实际使用的分隔符一致(除逗号外常见的还有分号、制表符、空格等)
- 若表头或字段内容包含被引号包裹的情况,需在分类器中开启引号识别配置
- 「列头来源」明确设置为首行数据,手动填写的列数需和实际CSV的列数完全一致
- 重新爬取前先删除Glue数据库中已生成的错误表结构:Glue爬虫默认会复用已存在的表元数据,不会自动覆盖更新,必须先删除旧表再重新运行爬虫才能加载新的识别结果
- 检查CSV文件编码:若文件为GBK、GB2312等非UTF-8编码,Glue按默认UTF-8解析时会出现表头乱码,判定首行不符合表头规则,可将文件转码为UTF-8无BOM格式后重新上传S3
- 确认目标S3爬取路径下无其他无关文件:如果路径下混有空文件、其他格式文件、结构不一致的CSV文件,会导致分类器匹配失败,建议将待爬的CSV文件单独放在独立的S3前缀目录下
内容的提问来源于stack exchange,提问作者Bokambo
相关产品推荐
相关产品推荐

