You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何训练输出尺寸可变的神经网络用于视频人体关键点预测

解决CNN-LSTM模型输出可变数量关键点的方案

以下是几个低复杂度、易集成到现有模型的可行思路:

1. 给每个关键点增加轻量置信度输出(推荐)

不用单独加"是否可见"参数,而是给每个关键点的坐标输出额外加一个置信度值(每个关键点输出从(x,y)变成(x,y,conf)),整体输出维度从(seq_len,4,2)变为(seq_len,4,3),复杂度增加极低:

  • 训练阶段:
    • 对可见的关键点:坐标部分用原有的回归loss(MSE等),置信度的目标设为1,用二分类loss(交叉熵或MSE)监督
    • 对不可见的关键点:坐标部分跳过loss计算(复用你之前的过滤逻辑),置信度的目标设为0,同样用二分类loss监督
  • 推理阶段:设定一个置信度阈值(比如0.5),过滤掉置信度低于阈值的关键点,自然得到可变数量的输出结果

这种方式完全兼容你现有的loss过滤逻辑,新增的参数极少,不会大幅提升模型复杂度。

2. 轻量分支预测关键点存在性

如果不想给每个坐标绑定置信度,可以在LSTM的输出后加一个极小的全连接分支(比如1层全连接层,输出维度为4),专门预测每个关键点的存在概率:

  • 训练阶段:可见点的存在概率标签设为1,不可见点设为0,用交叉熵loss监督这个分支;坐标回归loss依然只计算可见点
  • 推理阶段:根据存在概率阈值过滤掉概率低的关键点,保留的就是当前帧可见的关键点

这个分支的参数非常少(比如LSTM输出维度是256的话,全连接层参数只有256*4+4=1028),几乎不会增加模型复杂度。

3. 注意力权重动态过滤

给每个关键点分配一个注意力权重,训练时让可见点的权重趋近于1,不可见点的权重趋近于0:

  • 把注意力权重作为坐标回归loss的权重,这样训练时模型会自动忽略权重低的不可见点
  • 推理时直接过滤掉注意力权重低于阈值的关键点,实现可变数量输出

这种方式可以和坐标回归任务共享特征,不需要额外的分支,复杂度最低。


内容的提问来源于stack exchange,提问作者Mrofsnart

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.21 15:48:47