如何在Jupyter Notebook中读取Vertex AI数据集并生成统计指标
Vertex AI数据集无法在Jupyter Notebook中查看的解决方法
前置环境检查
- 安装最新版依赖包:
pip install --upgrade google-cloud-aiplatform gcsfs pillow - 完成账号身份验证:
- Colab环境直接运行
from google.colab import auth; auth.authenticate_user() - 本地Jupyter环境在终端运行
gcloud auth application-default login
- Colab环境直接运行
- 初始化Vertex AI客户端,替换为你自己的项目参数:
import vertexai vertexai.init(project="你的GCP项目ID", location="数据集所在区域")
数据集资源ID可从Vertex AI控制台数据集详情页复制,格式为projects/<项目ID>/locations/<区域>/datasets/<数据集ID>
按数据集类型加载查看
1. 表格类数据集
可直接转为Pandas DataFrame查看:
from google.cloud import aiplatform # 加载表格数据集 dataset = aiplatform.TabularDataset("你的数据集资源ID") # 小数据集全量加载,大数据集可添加limit参数限制返回行数 df = dataset.to_pandas(limit=1000) # 查看前5行数据 df.head()
2. 非结构化数据集(图像、文本、音频等)
先拉取元数据,按需加载单条样本避免内存占用过高:
# 以图像数据集为例,文本/视频数据集替换为TextDataset/VideoDataset即可 dataset = aiplatform.ImageDataset("你的数据集资源ID") # 拉取前10条样本的元数据 data_items = dataset.list_data_items()[:10] # 遍历查看样本存储地址和标注信息 for item in data_items: print("样本GCS存储地址:", item.gcs_uri) print("样本标注信息:", item.annotations) # 在Notebook中直接显示图像样本 from PIL import Image import gcsfs fs = gcsfs.GCSFileSystem() with fs.open(data_items[0].gcs_uri) as f: img = Image.open(f) display(img)
常见问题排查
- 拉取数据为空:确认项目ID、区域、数据集资源ID三个参数完全匹配,数据集处于正常可用状态
- 权限报错:确认当前登录账号拥有该数据集的
roles/aiplatform.viewer及以上权限 - 大数据集加载卡顿:不要直接全量拉取,可先将数据集导出到BigQuery,通过SQL语句采样查询再加载到Notebook
- 生成统计指标时,非结构化数据集可直接基于
list_data_items()返回的元数据做聚合计算,无需拉取原始文件,可大幅提升效率
内容的提问来源于stack exchange,提问作者Ajinkya Mishrikotkar
相关产品推荐
相关产品推荐

