You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

GCP Vertex AI更新数据集与训练AutoML模型问题咨询

GCP Vertex AI 文本实体抽取数据集迭代问题解答

针对你在使用Vertex AI管理文本实体抽取数据集、训练AutoML模型时遇到的数据集更新、模型迭代问题,解答如下:

问题1:是否需要重新上传全部文件(原有25个+新增10个共35个)?

不需要重复上传已经入库的25个旧文件。
你可以直接在已创建的contract_delivery_02数据集内按以下步骤操作:

  • 先进入数据集标签配置页,新增DelPrice、DelDelivery两个目标标签
  • 选择增量导入数据入口,只上传10个新增文件即可
  • 给新上传的文件完成实体标注后,数据集会自动合并原有标注数据和新增数据,不需要重复上传、重复标注已有内容。

问题2:是否需要完整重训整个AutoML模型?有没有更优处理方案?

AutoML实体抽取模型不支持在已训练完成的模型上直接新增标签能力,要让模型识别新增的2个标签,必须启动重训,但你可以根据业务场景选成本更低、风险更小的方案,不用每次迭代都硬上全量单模型重训:

  • 方案一:单模型全量重训(适合长期迭代、运维资源少的场景)
    重训前做好数据集分层拆分,保证原有3个标签(DelIncoTerms、DelLocation、DelWindow)在训练集、验证集、测试集的分布和你之前训练出效果良好的老模型时的分布一致,避免新数据加入打乱原有标签的识别精度;训练前确认每个新增标签的标注实体量不少于50个,否则新标签识别效果会很差。
  • 方案二:多模型路由推理(适合快速上线、不想影响现有稳定业务的场景)
    不用动已经跑稳的老模型,单独用新增的10个标注文件+少量旧文件做负样本,训练一个仅识别DelPrice、DelDelivery两个新标签的轻量AutoML模型。线上推理时加一层路由:待识别文本先走老模型抽取3个原有标签,再走新模型抽取2个新增标签,结果合并后返回。这种方案训练速度快、算力成本低,完全不会影响现有线上业务的识别效果,等后续新标签积累了足够多的标注样本,再合并数据集重训成单模型即可。

注意:不要尝试仅用10个新文件训练模型后直接替换老模型,样本量严重不足会导致新标签泛化性极差,还会直接丢失原有3个标签的识别能力。

内容的提问来源于stack exchange,提问作者tt0206

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 23:18:19