You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

按Sagemaker示例创建Glue爬虫后,调用Glue Client获表列表为空

排查Glue爬虫无表生成的解决方案

基础检查步骤

  • 确认Glue爬虫运行状态:进入Glue控制台,找到对应爬虫,查看最近一次运行日志,检查是否存在权限不足、S3路径无效、数据格式不兼容等报错
  • 验证S3存储桶路径:确保爬虫配置的S3路径正确,且路径下存在CSV/Parquet等Glue支持格式的有效数据文件,空路径或无有效文件会导致无表生成
  • 确认genai-workshop200数据库存在:在Glue控制台数据库列表中核实该数据库已创建,若未创建,需检查示例中数据库创建步骤的执行情况

权限排查

  • 检查爬虫执行角色权限:角色需具备AmazonS3FullAccess(或精细化S3读写权限)、AWSGlueServiceRole权限,以及目标S3桶的访问权限
  • 验证S3桶策略:确认桶策略未阻止Glue服务访问,避免存在拒绝Glue相关主体的规则

爬虫配置细节检查

  • 核实分类器配置:使用自定义分类器时需验证其匹配数据格式;使用默认分类器时,确保数据格式在Glue支持范围内
  • 检查排除模式:确认未误配置排除规则导致所有文件被过滤
  • 验证数据库关联:确认爬虫指定的目标数据库为genai-workshop200,避免配置错误关联至其他数据库

代码层面排查

  • 检查parse_catalog函数参数:确认get_tables方法的DatabaseName参数准确传入genai-workshop200,避免拼写错误
  • 验证boto3客户端区域:确保客户端区域与Glue数据库、S3桶所在区域一致,跨区域调用会导致无法获取表信息
  • 手动调用boto3接口测试:执行以下代码验证是否能获取表:
import boto3
glue_client = boto3.client('glue', region_name='你的资源所在区域')
response = glue_client.get_tables(DatabaseName='genai-workshop200')
print(response['TableList'])

其他可能原因

  • 数据文件问题:文件名含特殊字符、文件损坏,或CSV无表头等不符合分类器预期的格式问题
  • 爬虫运行超时:若S3路径下数据量过大,爬虫可能未完成运行,需查看运行时长是否超过配置的超时时间

内容的提问来源于stack exchange,提问作者datagekk

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.08 05:32:19