You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

通过Glue爬虫从S3 Parquet创建的表,Athena查询无结果返回

Athena查询Glue生成的Parquet表无数据的排查方案
  • 路径匹配问题
    检查Glue表的Location配置,确保指向包含所有Parquet文件的父目录(末尾建议带斜杠)。如果文件存放在子目录,需在表属性中添加recursive.directories=true,让Athena递归扫描所有子目录下的文件。

  • Schema兼容问题
    本地能读取不代表Schema和Glue表完全匹配,可能存在数据类型隐性差异:

    • 用parquet-tools schema s3://你的存储桶路径/文件.parquet查看文件原生Schema
    • 对比Glue表的列类型,手动调整Glue表Schema使其完全匹配,之后重新同步表元数据
  • 分区加载问题
    如果文件按分区存储,执行MSCK REPAIR TABLE 你的表名;命令,让Athena加载所有分区数据。若爬虫未识别分区,删除现有表后重新创建爬虫,开启“分区检测”功能。

  • 权限配置问题
    确认Athena执行角色拥有对应S3路径的s3:GetObject和s3:ListBucket权限。可通过IAM控制台给角色添加包含目标S3路径的权限策略。

  • Parquet格式兼容性问题
    Python生成Parquet时,尽量使用Athena支持的压缩格式(如gzip、snappy),避免使用lz4_raw等小众压缩算法。示例:

    df.to_parquet('output.parquet', compression='gzip')
    

    重新生成文件上传后,重新运行Glue爬虫更新表元数据。

内容的提问来源于stack exchange,提问作者xpansionfactor

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.19 03:20:16