You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Frame/Object/User Meta在NVIDIA Data Types中的差异通俗解释

Frame Meta、Object Meta、User Meta 区别说明

直接拿拍摄街头探店视频的场景举例,三者是标准套娃式嵌套结构,从外到内的定位完全不重叠:

Frame Meta(帧元数据)

这是最外层的基础属性,由采集设备、编码系统自动生成,和画面内容无关,只描述帧本身的固有属性。
比如某一帧的时间戳是视频第1分23秒、分辨率为4K、编码格式是H.265、拍摄时设备GPS定位在某某路咖啡店门口、拍摄参数为ISO200、快门速度1/100s,这些都属于Frame Meta。这类信息不需要分析画面内容,设备拍摄时就会自动写入,一般为只读属性,随意修改会导致帧解析出错。

Object Meta(对象元数据)

这是嵌在Frame Meta里的中间层信息,是AI识别、人工标注产出的、针对帧内具体目标的结构化结果,核心描述画面的实际内容。
比如刚才那帧咖啡店的画面,算法识别出3个独立目标:

  • 穿白T恤的店员,边界框坐标<210,80,450,980>,识别置信度97%,动作是制作咖啡
  • 冰美式咖啡,边界框坐标<600,420,680,650>,识别置信度92%
  • 店门口的橘猫,边界框坐标<10,800,200,1020>,识别置信度99%,动作是睡觉
    这些绑定在帧内具体物体上的属性,就是Object Meta。它的字段一般是识别平台预设好的,你可以修正标注结果,但不能随意改动字段结构。

User Meta(用户元数据)

这是最内层的完全自定义信息,是使用数据的业务方自行添加的扩展标记,和系统生成的帧属性、算法识别的对象属性没有强制关联,既可以挂在整个帧的层级,也可以挂在某个具体对象上。
比如你给这帧加标记「这段要剪成探店封面」,给那只橘猫的对象加标记「这是店里的招财猫,要给3秒特写」,甚至塞自定义字段cover_candidate=1、highlight=true给后期剪辑脚本自动读取,这些由你自定义字段、自行赋值的内容,全属于User Meta。没有规则限制存储内容,只要配套的业务逻辑能正常读取即可。


一句话快速区分

  • Frame Meta:说明「这帧本身是什么参数、在哪拍的、什么时候拍的」
  • Object Meta:说明「这帧里有什么东西、东西在哪、在做什么」
  • User Meta:说明「我要给这帧/帧里的对象加什么业务专属标记」

内容的提问来源于stack exchange,提问作者Koustubh Rao

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.28 09:09:56