You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用AWS Crawler仅加载元数据到数据目录表中

仅将S3 CSV文件元信息填充到AWS Glue数据目录表的方法

默认情况下AWS Glue Crawler会解析CSV内容生成列结构,同时记录文件元数据。要只保留元信息(文件路径、大小、修改时间等),可以通过以下两种方式实现:

方法1:自定义CSV分类器并禁用列解析

  • 进入AWS Glue控制台的分类器页面,创建自定义CSV分类器
  • 在分类器配置中,关闭「推断列名和数据类型」的选项(不同版本控制台可能表述为“不解析列”)
  • 将这个自定义分类器绑定到你的Crawler,替换默认的CSV分类器
  • 删除之前生成的包含内容列的表,重新运行Crawler,此时生成的表只会包含文件元数据字段

方法2:使用Prefix分类器(仅抓取文件级元数据)

  • 创建Prefix类型的分类器,指定你的S3存储路径前缀
  • 配置Crawler使用这个Prefix分类器,它不会解析任何文件内容,仅识别S3上的文件对象,记录每个文件的元数据(路径、大小、修改时间等)
  • 这种方式下,表的每条记录对应一个S3 CSV文件,而非CSV内的单行数据

注意事项

  • 必须先删除已生成的包含CSV内容列的表,再重新运行配置后的Crawler,否则新的元数据会和旧表结构冲突
  • 元数据字段的具体命名可能因Crawler设置略有差异,比如s3_location对应文件路径,file_size对应文件大小

内容的提问来源于stack exchange,提问作者BigD

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 19:20:47