You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从Parquet文件训练AutoML模型?当前仅支持BigQuery和CSV

从GCS上的Parquet文件训练Vertex AI AutoML模型

可以直接使用存储在GCS上的Parquet文件训练AutoML表格模型,以下是两种可行方法:

方法一:通过Vertex AI控制台操作

  • 登录Vertex AI控制台,创建新的表格数据集
  • 在数据源选择步骤,选择「云存储」选项
  • 输入GCS上Parquet文件的路径(支持单个文件路径,或用通配符*匹配同一文件夹下的多个Parquet文件,比如gs://your-bucket/data/*.parquet)
  • 完成数据集导入后,即可按照常规流程启动AutoML训练任务

方法二:使用命令行或Python SDK

Python SDK示例

from google.cloud import aiplatform

# 初始化AI平台客户端
aiplatform.init(project="你的项目ID", location="us-central1")

# 从GCS Parquet文件创建表格数据集
dataset = aiplatform.TabularDataset.create(
    display_name="自定义数据集名称",
    gcs_source="gs://your-bucket/path/to/your-data.parquet"
)

# 启动AutoML训练
job = aiplatform.AutoMLTabularTrainingJob(
    display_name="训练任务名称",
    optimization_prediction_type="classification" # 或"regression"
)

model = job.run(
    dataset=dataset,
    target_column="目标列名称",
    training_fraction_split=0.8,
    validation_fraction_split=0.1,
    test_fraction_split=0.1
)

gcloud命令行示例

# 创建表格数据集
gcloud ai datasets create \
  --display-name=自定义数据集名称 \
  --table \
  --gcs-source=gs://your-bucket/path/to/*.parquet \
  --region=us-central1

# 启动AutoML训练任务(替换数据集ID和目标列)
gcloud ai jobs create automl-tabular \
  --display-name=训练任务名称 \
  --dataset=projects/你的项目ID/locations/us-central1/datasets/数据集ID \
  --target-column=目标列名称 \
  --optimization-objective=minimize-log-loss \
  --region=us-central1

补充说明:尽管官方文档中分类/回归数据集创建页面主要提及BigQuery和CSV格式,但Vertex AI AutoML表格模型原生支持Parquet作为GCS数据源,导入后的数据集与其他格式来源的数据集使用方式完全一致,训练流程无差异。

内容的提问来源于stack exchange,提问作者tskuzzy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.17 11:30:56