You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

GCP Vertex AI:Feature Store与Dataset的差异及服务节点作用问询

谷歌云Vertex AI中Feature Store与Dataset的区别及离线/在线节点用途

一、Feature Store与Dataset的区别

  • 定位与核心目标:Dataset是基础的数据管理组件,主要负责数据的归集、存储和初步预处理,核心是为模型训练提供可用的数据集;Feature Store则是专门的特征管理平台,聚焦特征的定义、复用、存储和高效调用,解决特征在训练与推理阶段的一致性、复用性问题。
  • 数据组织逻辑:Dataset以“数据集”为单位,按文件、表格或数据源(如BigQuery表)来组织,更偏向原始或加工后的数据集合;Feature Store以“实体-特征”为核心逻辑,将特征按业务实体(如用户、商品、订单)分组,方便按实体快速检索和组合所需特征。
  • 适用场景:Dataset多用于模型开发前期的数据准备环节,比如导入原始数据、做清洗转换、拆分训练验证集;Feature Store覆盖从模型开发到上线的全流程,训练时可批量拉取历史特征,推理时能实时获取最新特征,还能避免重复计算特征、监控特征漂移。

二、Feature Store设置离线与在线服务节点的原因及用途

训练和实时推理对特征获取的要求差异极大,因此拆分出两种服务节点:

离线服务节点

  • 核心用途:满足模型训练阶段的批量特征需求。训练模型需要大量历史特征数据,离线节点基于大数据存储系统,能高效处理TB级以上的批量查询,生成包含历史特征的训练数据集,还支持回溯历史特征快照,方便模型迭代和验证。
  • 特点:对延迟要求低,但需要高吞吐量,适合批量数据处理,同时能保留全量历史特征数据。

在线服务节点

  • 核心用途:支撑实时推理场景的低延迟特征查询。当模型上线后,面对实时业务请求(如实时推荐、实时风控),需要在毫秒级返回对应的特征值,在线节点基于内存型存储,能快速响应单条或少量特征查询,保证推理的时效性。
  • 特点:对延迟要求极高(通常毫秒级),吞吐量适配实时请求量,会定期同步离线节点的最新特征数据,确保推理时使用的是最新特征值。

内容的提问来源于stack exchange,提问作者gabriel11

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.10 10:45:40