You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在GCP Vertex AI Dataset加载带训练目标的文件以重训模型?

解决Vertex AI文本分类数据集加载带标签数据的问题

方案1:使用符合规范的数据源格式导入

Vertex AI的TextDataset导入带标签数据时,核心是让数据源文件(CSV或JSONL)包含文本内容和对应标签,且格式匹配官方schema要求。以CSV为例,文件结构需如下:

text,label
"用户输入文本1","类别A"
"用户输入文本2","类别B"

调用import_data或create方法时,指定对应schema URI(单标签文本分类用gs://google-cloud-aiplatform/schema/dataset/ioformat/text_classification_single_label_io_format_1.0.0.yaml),示例代码:

from google.cloud import aiplatform

aiplatform.init(project="你的项目ID", location="你的区域")

# 创建并导入带标签的数据集
dataset = aiplatform.TextDataset.create(
    display_name="文本分类重训数据集",
    gcs_source=["gs://你的存储桶路径/带标签数据.csv"],
    import_schema_uri="gs://google-cloud-aiplatform/schema/dataset/ioformat/text_classification_single_label_io_format_1.0.0.yaml"
)

导入完成后,数据集会自动关联文本与标签,后续重训可直接调用该数据集。

方案2:从BigQuery加载带标签数据

若数据存储在BigQuery表中(表需包含text和label字段),可直接通过BigQuery源导入,示例代码:

dataset = aiplatform.TextDataset.create(
    display_name="BigQuery文本分类数据集",
    bq_source="bq://你的项目ID.数据集ID.表ID",
    import_schema_uri="gs://google-cloud-aiplatform/schema/dataset/ioformat/text_classification_single_label_io_format_1.0.0.yaml"
)

方案3:为已存在的数据集补充导入标签

如果已经创建了空数据集或未带标签的数据集,可通过import_data方法补充导入带标签的数据源,确保数据源格式符合schema要求:

# 加载已存在的数据集
dataset = aiplatform.TextDataset("projects/你的项目ID/locations/你的区域/datasets/你的数据集ID")

# 导入带标签数据
dataset.import_data(
    gcs_source=["gs://你的存储桶路径/补充带标签数据.csv"],
    import_schema_uri="gs://google-cloud-aiplatform/schema/dataset/ioformat/text_classification_single_label_io_format_1.0.0.yaml"
)

关键注意事项

  • 数据源字段名需与schema匹配:默认schema要求文本字段名为text,标签字段名为label,若你的字段名不同,需修改数据源列名或自定义schema。
  • 版本兼容:你使用的aiplatform 1.25.0版本完全支持上述所有方法,无需升级依赖包。

内容的提问来源于stack exchange,提问作者Federico Scaltriti

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.19 16:45:11