如何使用AWS Crawler仅加载元数据到数据目录表中
仅将S3 CSV文件元信息填充到AWS Glue数据目录表的方法
默认情况下AWS Glue Crawler会解析CSV内容生成列结构,同时记录文件元数据。要只保留元信息(文件路径、大小、修改时间等),可以通过以下两种方式实现:
方法1:自定义CSV分类器并禁用列解析
- 进入AWS Glue控制台的分类器页面,创建自定义CSV分类器
- 在分类器配置中,关闭「推断列名和数据类型」的选项(不同版本控制台可能表述为“不解析列”)
- 将这个自定义分类器绑定到你的Crawler,替换默认的CSV分类器
- 删除之前生成的包含内容列的表,重新运行Crawler,此时生成的表只会包含文件元数据字段
方法2:使用Prefix分类器(仅抓取文件级元数据)
- 创建
Prefix类型的分类器,指定你的S3存储路径前缀 - 配置Crawler使用这个Prefix分类器,它不会解析任何文件内容,仅识别S3上的文件对象,记录每个文件的元数据(路径、大小、修改时间等)
- 这种方式下,表的每条记录对应一个S3 CSV文件,而非CSV内的单行数据
注意事项
- 必须先删除已生成的包含CSV内容列的表,再重新运行配置后的Crawler,否则新的元数据会和旧表结构冲突
- 元数据字段的具体命名可能因Crawler设置略有差异,比如
s3_location对应文件路径,file_size对应文件大小
内容的提问来源于stack exchange,提问作者BigD
相关产品推荐
相关产品推荐

