无法在Web UI启动GCP AutoML实体抽取模型训练求助
我之前也碰到过类似的糟心情况,结合GCP AutoML实体抽取的常见限制和欧盟区域的特殊配置,给你几个实用的排查方向:
检查PDF文档的兼容性:AutoML实体抽取对PDF有隐性格式要求,务必确认你的PDF不是纯扫描件(图片式PDF),也没有加密、损坏或内嵌异常内容的情况。哪怕你已经完成标注,部分特殊格式的PDF可能在后台校验环节不通过,导致训练按钮静默锁定。可以挑几份标注过的PDF重新上传测试,或者转成纯文本格式验证内容是否能被正常识别。
确认标签标注的深层分布要求:虽然你提到每个数据集都满足至少10个标注的最低要求,但AutoML可能还有隐藏规则——比如单个标签在训练/验证/测试集中的实例数量不能过少(比如某一集合里某个标签只有1-2个实例),或者标签之间的标注存在逻辑冲突。你可以导出标注统计数据,仔细核对每个标签在三个集合中的分布,尝试调整数据集划分,保证每个标签在各集合中都有足够的有效标注实例。
欧盟区域合规性配置检查:因为你的数据集在欧盟,得确认是否完成了GCP的GDPR相关配置,比如数据主体授权、数据处理记录的设置。部分合规项未完成时,AutoML会静默限制训练操作,且不会给出明确提示。可以进入GCP控制台的「IAM与管理」→「合规性」模块,检查是否有未完成的合规任务。
验证数据集的后台同步状态:标注完成后,后台需要时间同步大体积PDF数据集的状态,尤其是74份6页的文档量。你可以先刷新页面,或者等待30分钟左右再尝试操作。如果还是不行,进入数据集的「详情」页面,滚动到最底部查看系统日志,可能会有隐藏的错误提示。
检查AutoML API启用与权限配置:哪怕用的是Web UI,训练操作也依赖Cloud AutoML API。确认你的GCP项目已经启用了该API,并且当前登录账号拥有足够权限(比如
automl.editor或owner角色)。可以进入GCP控制台的「API与服务」→「已启用的API」,搜索确认AutoML API的状态。
内容的提问来源于stack exchange,提问作者Clément

