目标检测需输入输出张量匹配吗?YOLOv8部署Android遇异常排查
问题解答
1. 目标检测是否要求输入与输出张量形状匹配?
不需要。目标检测模型的输入是图像张量(格式通常为[batch, channels, height, width]),输出是模型检测头生成的预测结果张量,其形状由模型结构、锚点数量、类别数决定,和输入形状没有强制匹配要求。比如你的YOLOv8输出[1, 31, 21504],其中31 = 4(边框坐标) + 1(置信度) + 27(类别数),21504是所有网格的锚点总数,这是YOLO系列的标准输出结构。
2. 解决IndexOutOfBoundsException的核心问题
你的代码错误地将输出张量的所有元素当作类别分数,直接取最大值索引去匹配27个类别,但输出张量里大部分元素是边框坐标、置信度,索引远超27,必然越界。正确的处理步骤是解析YOLOv8的输出结构,提取有效检测框的类别信息:
步骤1:正确解析YOLOv8输出张量
YOLOv8的输出张量[1, 31, 21504]可以转置为[1, 21504, 31],每个锚点对应一个长度为31的数组:
- 索引0-3:边框的
x,y,w,h(需要转换为图像实际坐标) - 索引4:该框的置信度(是否包含物体)
- 索引5-31:27个类别的概率得分
步骤2:修改analyzeImage方法
替换原有的输出处理逻辑,改为过滤低置信度框,提取类别:
@OptIn(markerClass = ExperimentalGetImage.class) void analyzeImage(ImageProxy image, int rotation) { try { Tensor inputTensor = TensorImageUtils.imageYUV420CenterCropToFloat32Tensor( image.getImage(), rotation, 1024, 1024, TensorImageUtils.TORCHVISION_NORM_MEAN_RGB, TensorImageUtils.TORCHVISION_NORM_STD_RGB); Tensor outputTensor = module.forward(IValue.from(inputTensor)).toTensor(); // 转置张量为[1, 21504, 31],方便按每个锚点处理 Tensor transposed = outputTensor.permute(new int[]{0, 2, 1}); float[] predictions = transposed.getDataAsFloatArray(); float confidenceThreshold = 0.5f; // 可调整的置信度阈值 String classResult = "No detection"; float maxClassScore = 0; int numAnchors = 21504; int elementsPerAnchor = 31; int classStartIndex = 5; // 类别概率从第5个元素开始 for (int i = 0; i < numAnchors; i++) { int baseIdx = i * elementsPerAnchor; float confidence = predictions[baseIdx + 4]; // 跳过低置信度的框 if (confidence < confidenceThreshold) { continue; } // 找到当前框的最高类别得分 for (int j = classStartIndex; j < elementsPerAnchor; j++) { float score = predictions[baseIdx + j]; if (score > maxClassScore) { maxClassScore = score; // 计算类别索引:j - classStartIndex classResult = classes.get(j - classStartIndex); } } } Log.v("ZackTensor", "Detected - " + classResult); runOnUiThread(() -> textView.setText(classResult)); // 释放临时张量 transposed.close(); } catch (Exception e) { e.printStackTrace(); } }
步骤3:确保模型导出正确
YOLOv8官方推荐用以下命令导出优化后的TorchScript/TorchLite模型,避免手动导出的兼容性问题:
# 导出TorchScript(适合移动端) yolo export model=your_model.pt format=torchscript imgsz=1024 device=cpu # 导出TorchLite(移动端专用优化) yolo export model=your_model.pt format=torchlite imgsz=1024 device=cpu
导出后的.ptl文件如果和.pt大小差异小,是因为YOLOv8的模型本身参数密集,移动端优化主要是算子融合、量化(如果启用),而非单纯压缩体积。可以添加int8=True开启量化进一步优化:
yolo export model=your_model.pt format=torchlite imgsz=1024 device=cpu int8=True
额外注意事项
- 确保
labels.txt的类别数量和模型训练时的类别数完全一致(27个),每行一个类别名称。 - 输入图像的归一化参数要和训练时一致,YOLOv8默认用
TORCHVISION_NORM_MEAN_RGB和TORCHVISION_NORM_STD_RGB,你的代码里已经正确设置,无需修改。
内容的提问来源于stack exchange,提问作者Zack
相关产品推荐
相关产品推荐

