You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何创建AWS Glue Crawler并关联S3存储桶?

AWS Glue Crawler 关联S3存储桶及完整创建步骤

给已创建的Glue Crawler关联S3存储桶

如果已经建好Crawler但没绑定S3桶,按以下步骤操作:

  • 登录AWS Glue控制台,进入「爬虫(Crawlers)」页面
  • 找到你创建的Crawler,点击它的名称进入详情页
  • 点击右上角的「编辑(Edit)」按钮,进入编辑流程
  • 在「数据源(Data sources)」步骤,点击「添加数据源(Add a data source)」
  • 数据源类型选择「S3」,然后配置S3路径:
    • 填写「包含路径(Included paths)」,格式比如s3://你的桶名/数据所在路径/
    • 若有不需要爬取的路径,可配置「排除路径(Excluded paths)」
  • 完成数据源配置后,依次走完后续编辑步骤(IAM角色、输出设置等保持原有配置即可),最后点击「完成(Finish)」保存修改

完整创建Glue Crawler爬取S3存储桶的步骤

1. 前期准备

  • 确认你的S3桶中已有待爬取的数据(比如CSV、Parquet这类常见格式文件)
  • 准备一个具备Glue和S3访问权限的IAM角色,没有的话创建Crawler时可让控制台自动生成

2. 逐步创建Crawler

  • 登录AWS Glue控制台,进入「爬虫(Crawlers)」页面,点击「添加爬虫(Add crawler)」
  • 步骤1:命名和描述
    给Crawler起个名称,可选添加描述,点击「下一步」
  • 步骤2:选择数据源类型
    选择「数据存储(Data stores)」,点击「下一步」
  • 步骤3:选择数据存储
    数据源选「S3」,输入S3桶的目标路径(支持单个或多个路径)
    选择爬取范围:「爬取所有子文件夹」或「仅爬取指定文件夹」,选完点击「下一步」
  • 步骤4:添加另一个数据源(可选)
    若只需爬取当前S3数据源,选择「不添加另一个数据源(No)」,点击「下一步」
  • 步骤5:选择IAM角色
    选择已有的符合权限的IAM角色,或选择「创建IAM角色」,输入角色名让控制台自动生成,点击「下一步」
  • 步骤6:配置爬取计划
    选择爬取频率:按需、每天、每周等,按需选择后点击「下一步」
  • 步骤7:配置输出
    选择目标数据库(没有的话点击「添加数据库」新建)
    可选填写「表名前缀」,点击「下一步」
  • 步骤8:审核并完成
    核对所有配置信息,确认无误后点击「完成(Finish)」

3. 运行Crawler

  • 返回Crawlers页面,选中刚创建的Crawler,点击「运行(Run)」
  • 等待爬取完成后,进入「数据库(Databases)」页面,找到目标数据库即可查看自动生成的表,表结构会对应S3中的数据格式

内容的提问来源于stack exchange,提问作者Dishank kabra

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 04:27:20