如何从Parquet文件训练AutoML模型?当前仅支持BigQuery和CSV
从GCS上的Parquet文件训练Vertex AI AutoML模型
可以直接使用存储在GCS上的Parquet文件训练AutoML表格模型,以下是两种可行方法:
方法一:通过Vertex AI控制台操作
- 登录Vertex AI控制台,创建新的表格数据集
- 在数据源选择步骤,选择「云存储」选项
- 输入GCS上Parquet文件的路径(支持单个文件路径,或用通配符
*匹配同一文件夹下的多个Parquet文件,比如gs://your-bucket/data/*.parquet) - 完成数据集导入后,即可按照常规流程启动AutoML训练任务
方法二:使用命令行或Python SDK
Python SDK示例
from google.cloud import aiplatform # 初始化AI平台客户端 aiplatform.init(project="你的项目ID", location="us-central1") # 从GCS Parquet文件创建表格数据集 dataset = aiplatform.TabularDataset.create( display_name="自定义数据集名称", gcs_source="gs://your-bucket/path/to/your-data.parquet" ) # 启动AutoML训练 job = aiplatform.AutoMLTabularTrainingJob( display_name="训练任务名称", optimization_prediction_type="classification" # 或"regression" ) model = job.run( dataset=dataset, target_column="目标列名称", training_fraction_split=0.8, validation_fraction_split=0.1, test_fraction_split=0.1 )
gcloud命令行示例
# 创建表格数据集 gcloud ai datasets create \ --display-name=自定义数据集名称 \ --table \ --gcs-source=gs://your-bucket/path/to/*.parquet \ --region=us-central1 # 启动AutoML训练任务(替换数据集ID和目标列) gcloud ai jobs create automl-tabular \ --display-name=训练任务名称 \ --dataset=projects/你的项目ID/locations/us-central1/datasets/数据集ID \ --target-column=目标列名称 \ --optimization-objective=minimize-log-loss \ --region=us-central1
补充说明:尽管官方文档中分类/回归数据集创建页面主要提及BigQuery和CSV格式,但Vertex AI AutoML表格模型原生支持Parquet作为GCS数据源,导入后的数据集与其他格式来源的数据集使用方式完全一致,训练流程无差异。
内容的提问来源于stack exchange,提问作者tskuzzy
相关产品推荐
相关产品推荐

