YOLOv7 Pose关键点输出格式疑问:数量、含义及对应关系解析求助
YOLOv7 Pose 输出解析及疑问解答
输出数组长度差异(58 vs 论文的51)
- 论文里的51个元素是纯关键点数据:17个关键点各对应x、y坐标+置信度,17×3=51。但实际推理输出会额外带上检测框的基础信息,这就是你得到58个元素的原因。
- 多出来的7个元素是检测框相关数据,格式为:
[batch_idx, class_id, x_center, y_center, width, height, box_confidence]- 你提到的
0, 0, 430.44, 476.19就是前四个:batch_idx(单批次输入时固定为0)、class_id(人体在COCO数据集里的ID是0)、x_center(检测框中心的x像素坐标)、y_center(检测框中心的y像素坐标) - 剩下3个分别是检测框的宽度、高度,以及这个框属于人体的置信度。
- 你提到的
18个置信度值的原因
- YOLOv7 Pose的工程实现中,会额外加一个整个人体姿态的综合置信度,加上17个关键点各自的置信度,刚好18个。论文里只标注了关键点的置信度,所以会出现数量不符的情况。
仓库示意图与实际预测的匹配性
- 仓库提供的示意图对应的是COCO标准17个关键点的顺序,只要你用的是官方预训练模型,实际预测的关键点顺序和它完全一致。可以自己验证:把输出里第8-10个元素(第一个关键点:鼻子)的x、y坐标在图上标记,看是否对应示意图里的鼻子位置,以此确认顺序是否匹配。
输出前7个值的明确含义
直接拆解每个位置的意义:
- 第一个值:
batch_idx——当前目标所属的批次索引,单图输入时固定为0 - 第二个值:
class_id——目标类别ID,人体在COCO里是0 - 第三个值:
x_center——检测框中心的x像素坐标 - 第四个值:
y_center——检测框中心的y像素坐标 - 第五个值:
width——检测框的宽度(像素) - 第六个值:
height——检测框的高度(像素) - 第七个值:
box_confidence——该检测框属于人体的置信度(范围0-1)
内容的提问来源于stack exchange,提问作者Tlaloc-ES
相关产品推荐
相关产品推荐

