如何创建AWS Glue Crawler并关联S3存储桶?
AWS Glue Crawler 关联S3存储桶及完整创建步骤
给已创建的Glue Crawler关联S3存储桶
如果已经建好Crawler但没绑定S3桶,按以下步骤操作:
- 登录AWS Glue控制台,进入「爬虫(Crawlers)」页面
- 找到你创建的Crawler,点击它的名称进入详情页
- 点击右上角的「编辑(Edit)」按钮,进入编辑流程
- 在「数据源(Data sources)」步骤,点击「添加数据源(Add a data source)」
- 数据源类型选择「S3」,然后配置S3路径:
- 填写「包含路径(Included paths)」,格式比如
s3://你的桶名/数据所在路径/ - 若有不需要爬取的路径,可配置「排除路径(Excluded paths)」
- 填写「包含路径(Included paths)」,格式比如
- 完成数据源配置后,依次走完后续编辑步骤(IAM角色、输出设置等保持原有配置即可),最后点击「完成(Finish)」保存修改
完整创建Glue Crawler爬取S3存储桶的步骤
1. 前期准备
- 确认你的S3桶中已有待爬取的数据(比如CSV、Parquet这类常见格式文件)
- 准备一个具备Glue和S3访问权限的IAM角色,没有的话创建Crawler时可让控制台自动生成
2. 逐步创建Crawler
- 登录AWS Glue控制台,进入「爬虫(Crawlers)」页面,点击「添加爬虫(Add crawler)」
- 步骤1:命名和描述
给Crawler起个名称,可选添加描述,点击「下一步」 - 步骤2:选择数据源类型
选择「数据存储(Data stores)」,点击「下一步」 - 步骤3:选择数据存储
数据源选「S3」,输入S3桶的目标路径(支持单个或多个路径)
选择爬取范围:「爬取所有子文件夹」或「仅爬取指定文件夹」,选完点击「下一步」 - 步骤4:添加另一个数据源(可选)
若只需爬取当前S3数据源,选择「不添加另一个数据源(No)」,点击「下一步」 - 步骤5:选择IAM角色
选择已有的符合权限的IAM角色,或选择「创建IAM角色」,输入角色名让控制台自动生成,点击「下一步」 - 步骤6:配置爬取计划
选择爬取频率:按需、每天、每周等,按需选择后点击「下一步」 - 步骤7:配置输出
选择目标数据库(没有的话点击「添加数据库」新建)
可选填写「表名前缀」,点击「下一步」 - 步骤8:审核并完成
核对所有配置信息,确认无误后点击「完成(Finish)」
3. 运行Crawler
- 返回Crawlers页面,选中刚创建的Crawler,点击「运行(Run)」
- 等待爬取完成后,进入「数据库(Databases)」页面,找到目标数据库即可查看自动生成的表,表结构会对应S3中的数据格式
内容的提问来源于stack exchange,提问作者Dishank kabra
相关产品推荐
相关产品推荐

