You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

MediaPipe手掌检测TFLite模型后处理获取128x128输入下手掌边界框方法咨询

TFLite 128x128手掌检测模型后处理方案

输出张量1x896x18的维度含义

你疑惑的18维数值是因为该模型同步输出边界框和手部关键点参数,具体拆分如下:

  • 前4位:边界框偏移参数,顺序为[x中心偏移, y中心偏移, 宽度偏移, 高度偏移],所有值为基于对应锚框的归一化偏移量
  • 后14位:7个预定义手部关键点的坐标偏移,每个关键点占2位(x偏移、y偏移),仅需边界框的场景下可直接忽略这部分数值

128x128输入对应的锚框参数

该模型为MediaPipe开源的单阶段手掌检测器,锚框遵循SSD多尺度生成规则,共生成896个归一化锚框,每个锚框参数包含[中心x, 中心y, 宽度, 高度],数值范围均在[0,1]区间,映射到128x128输入时直接乘以128即可得到像素级锚框参数。

边界框解码流程

  1. 置信度过滤:对1x896的置信度张量逐值做sigmoid激活,设置阈值(推荐0.5~0.7),过滤得分低于阈值的锚框
  2. 边界框解码:对剩余有效锚框,结合对应锚框参数做偏移解码,公式如下(所有计算先在归一化区间完成):
# 0.1477为模型训练时预设的偏移缩放系数,不可省略
decoded_x_center = anchor_x_center + x_offset * 0.1477 * anchor_width
decoded_y_center = anchor_y_center + y_offset * 0.1477 * anchor_height
decoded_width = anchor_width * exp(width_offset * 0.1477)
decoded_height = anchor_height * exp(height_offset * 0.1477)
  1. 非极大值抑制:对所有解码后的边界框做IOU阈值为0.3~0.5的NMS,消除重复检测框,剩余结果即为有效手掌框
  2. 坐标映射:将归一化的边界框参数乘以128,即可得到128x128输入图像下的像素级边界框,可按需转换为[xmin, ymin, xmax, ymax]格式使用

内容的提问来源于stack exchange,提问作者Beni

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 14:06:03