GCP Vertex AI更新数据集与训练AutoML模型问题咨询
GCP Vertex AI 文本实体抽取数据集迭代问题解答
针对你在使用Vertex AI管理文本实体抽取数据集、训练AutoML模型时遇到的数据集更新、模型迭代问题,解答如下:
问题1:是否需要重新上传全部文件(原有25个+新增10个共35个)?
不需要重复上传已经入库的25个旧文件。
你可以直接在已创建的contract_delivery_02数据集内按以下步骤操作:
- 先进入数据集标签配置页,新增
DelPrice、DelDelivery两个目标标签 - 选择增量导入数据入口,只上传10个新增文件即可
- 给新上传的文件完成实体标注后,数据集会自动合并原有标注数据和新增数据,不需要重复上传、重复标注已有内容。
问题2:是否需要完整重训整个AutoML模型?有没有更优处理方案?
AutoML实体抽取模型不支持在已训练完成的模型上直接新增标签能力,要让模型识别新增的2个标签,必须启动重训,但你可以根据业务场景选成本更低、风险更小的方案,不用每次迭代都硬上全量单模型重训:
- 方案一:单模型全量重训(适合长期迭代、运维资源少的场景)
重训前做好数据集分层拆分,保证原有3个标签(DelIncoTerms、DelLocation、DelWindow)在训练集、验证集、测试集的分布和你之前训练出效果良好的老模型时的分布一致,避免新数据加入打乱原有标签的识别精度;训练前确认每个新增标签的标注实体量不少于50个,否则新标签识别效果会很差。 - 方案二:多模型路由推理(适合快速上线、不想影响现有稳定业务的场景)
不用动已经跑稳的老模型,单独用新增的10个标注文件+少量旧文件做负样本,训练一个仅识别DelPrice、DelDelivery两个新标签的轻量AutoML模型。线上推理时加一层路由:待识别文本先走老模型抽取3个原有标签,再走新模型抽取2个新增标签,结果合并后返回。这种方案训练速度快、算力成本低,完全不会影响现有线上业务的识别效果,等后续新标签积累了足够多的标注样本,再合并数据集重训成单模型即可。
注意:不要尝试仅用10个新文件训练模型后直接替换老模型,样本量严重不足会导致新标签泛化性极差,还会直接丢失原有3个标签的识别能力。
内容的提问来源于stack exchange,提问作者tt0206
相关产品推荐
相关产品推荐

