You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于UCF-101数据集CNN-LSTM人体活动分类最终评估指标的问询

关于UCF-101人体活动分类评估指标的解答

嘿,这个问题问到点子上了!毕竟搞UCF-101的活动分类,评估逻辑没搞对,性能对比就没意义了。结合我做相关研究的经验,给你掰扯清楚:

主流评估:单视频级别的类别准确率

UCF-101的核心任务是视频级的活动分类——每个视频对应唯一的类别标签,这是数据集的核心设定。你预处理提取的多帧,本质是给模型输入的序列特征(比如一个视频抽20-30帧组成时序序列),模型最终要输出的是整个视频的类别预测:

  • 常见做法是:用CNN提取每帧的空间特征,再喂给LSTM捕捉时序关联,最后通过LSTM的最终输出层(或者对所有帧的预测结果做加权平均/取最大概率)得到这个视频的类别预测。
  • 然后把这个预测和视频的真实标签对比,统计所有视频中预测正确的比例,这就是你在文献里看到的“分类准确率”,混淆矩阵也是基于视频级的预测结果和真实标签来生成的(每个单元格对应某类视频被分到某类的数量/比例)。

帧级准确率的适用场景

帧级准确率一般只用来做中间分析,比如:

  • 验证你的CNN模块对单帧动作的特征提取能力;
  • 做消融实验时,单独看时序模块(LSTM)对帧级特征的整合效果。
    但这绝对不是最终评估模型性能的指标,因为咱们的任务是判断“整个视频的活动类别”,而不是“每一帧属于哪个活动”——毕竟很多活动是时序连贯的,单帧可能根本无法判断(比如“打篮球”的某一帧可能和“抬手”没区别)。

小提醒

在你的实验里,一定要把每个视频的多帧序列当成一个独立样本,模型输出该样本的类别预测,再统计所有视频样本的准确率,这才符合任务目标和学界通用的评估标准哦!

内容的提问来源于stack exchange,提问作者deep-i

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.08 15:03:15