You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Jupyter Notebook中读取Vertex AI数据集并生成统计指标

Vertex AI数据集无法在Jupyter Notebook中查看的解决方法

前置环境检查

  • 安装最新版依赖包:pip install --upgrade google-cloud-aiplatform gcsfs pillow
  • 完成账号身份验证:
    • Colab环境直接运行from google.colab import auth; auth.authenticate_user()
    • 本地Jupyter环境在终端运行gcloud auth application-default login
  • 初始化Vertex AI客户端,替换为你自己的项目参数:
import vertexai
vertexai.init(project="你的GCP项目ID", location="数据集所在区域")

数据集资源ID可从Vertex AI控制台数据集详情页复制,格式为projects/<项目ID>/locations/<区域>/datasets/<数据集ID>

按数据集类型加载查看

1. 表格类数据集

可直接转为Pandas DataFrame查看:

from google.cloud import aiplatform

# 加载表格数据集
dataset = aiplatform.TabularDataset("你的数据集资源ID")
# 小数据集全量加载,大数据集可添加limit参数限制返回行数
df = dataset.to_pandas(limit=1000)
# 查看前5行数据
df.head()

2. 非结构化数据集(图像、文本、音频等)

先拉取元数据,按需加载单条样本避免内存占用过高:

# 以图像数据集为例,文本/视频数据集替换为TextDataset/VideoDataset即可
dataset = aiplatform.ImageDataset("你的数据集资源ID")
# 拉取前10条样本的元数据
data_items = dataset.list_data_items()[:10]

# 遍历查看样本存储地址和标注信息
for item in data_items:
    print("样本GCS存储地址:", item.gcs_uri)
    print("样本标注信息:", item.annotations)

# 在Notebook中直接显示图像样本
from PIL import Image
import gcsfs

fs = gcsfs.GCSFileSystem()
with fs.open(data_items[0].gcs_uri) as f:
    img = Image.open(f)
display(img)

常见问题排查

  • 拉取数据为空:确认项目ID、区域、数据集资源ID三个参数完全匹配,数据集处于正常可用状态
  • 权限报错:确认当前登录账号拥有该数据集的roles/aiplatform.viewer及以上权限
  • 大数据集加载卡顿:不要直接全量拉取,可先将数据集导出到BigQuery,通过SQL语句采样查询再加载到Notebook
  • 生成统计指标时,非结构化数据集可直接基于list_data_items()返回的元数据做聚合计算,无需拉取原始文件,可大幅提升效率

内容的提问来源于stack exchange,提问作者Ajinkya Mishrikotkar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.05 20:45:02