You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

目标检测需输入输出张量匹配吗?YOLOv8部署Android遇异常排查

问题解答

1. 目标检测是否要求输入与输出张量形状匹配?

不需要。目标检测模型的输入是图像张量(格式通常为[batch, channels, height, width]),输出是模型检测头生成的预测结果张量,其形状由模型结构、锚点数量、类别数决定,和输入形状没有强制匹配要求。比如你的YOLOv8输出[1, 31, 21504],其中31 = 4(边框坐标) + 1(置信度) + 27(类别数),21504是所有网格的锚点总数,这是YOLO系列的标准输出结构。

2. 解决IndexOutOfBoundsException的核心问题

你的代码错误地将输出张量的所有元素当作类别分数,直接取最大值索引去匹配27个类别,但输出张量里大部分元素是边框坐标、置信度,索引远超27,必然越界。正确的处理步骤是解析YOLOv8的输出结构,提取有效检测框的类别信息:

步骤1:正确解析YOLOv8输出张量

YOLOv8的输出张量[1, 31, 21504]可以转置为[1, 21504, 31],每个锚点对应一个长度为31的数组:

  • 索引0-3:边框的x,y,w,h(需要转换为图像实际坐标)
  • 索引4:该框的置信度(是否包含物体)
  • 索引5-31:27个类别的概率得分

步骤2:修改analyzeImage方法

替换原有的输出处理逻辑,改为过滤低置信度框,提取类别:

@OptIn(markerClass = ExperimentalGetImage.class) 
void analyzeImage(ImageProxy image, int rotation) {
    try {
        Tensor inputTensor = TensorImageUtils.imageYUV420CenterCropToFloat32Tensor(
                image.getImage(), rotation, 1024, 1024, 
                TensorImageUtils.TORCHVISION_NORM_MEAN_RGB, 
                TensorImageUtils.TORCHVISION_NORM_STD_RGB);
        Tensor outputTensor = module.forward(IValue.from(inputTensor)).toTensor();

        // 转置张量为[1, 21504, 31],方便按每个锚点处理
        Tensor transposed = outputTensor.permute(new int[]{0, 2, 1});
        float[] predictions = transposed.getDataAsFloatArray();
        
        float confidenceThreshold = 0.5f; // 可调整的置信度阈值
        String classResult = "No detection";
        float maxClassScore = 0;

        int numAnchors = 21504;
        int elementsPerAnchor = 31;
        int classStartIndex = 5; // 类别概率从第5个元素开始

        for (int i = 0; i < numAnchors; i++) {
            int baseIdx = i * elementsPerAnchor;
            float confidence = predictions[baseIdx + 4];
            
            // 跳过低置信度的框
            if (confidence < confidenceThreshold) {
                continue;
            }

            // 找到当前框的最高类别得分
            for (int j = classStartIndex; j < elementsPerAnchor; j++) {
                float score = predictions[baseIdx + j];
                if (score > maxClassScore) {
                    maxClassScore = score;
                    // 计算类别索引:j - classStartIndex
                    classResult = classes.get(j - classStartIndex);
                }
            }
        }

        Log.v("ZackTensor", "Detected - " + classResult);
        runOnUiThread(() -> textView.setText(classResult));
        
        // 释放临时张量
        transposed.close();
    } catch (Exception e) {
        e.printStackTrace();
    }
}

步骤3:确保模型导出正确

YOLOv8官方推荐用以下命令导出优化后的TorchScript/TorchLite模型,避免手动导出的兼容性问题:

# 导出TorchScript(适合移动端)
yolo export model=your_model.pt format=torchscript imgsz=1024 device=cpu

# 导出TorchLite(移动端专用优化)
yolo export model=your_model.pt format=torchlite imgsz=1024 device=cpu

导出后的.ptl文件如果和.pt大小差异小,是因为YOLOv8的模型本身参数密集,移动端优化主要是算子融合、量化(如果启用),而非单纯压缩体积。可以添加int8=True开启量化进一步优化:

yolo export model=your_model.pt format=torchlite imgsz=1024 device=cpu int8=True

额外注意事项

  • 确保labels.txt的类别数量和模型训练时的类别数完全一致(27个),每行一个类别名称。
  • 输入图像的归一化参数要和训练时一致,YOLOv8默认用TORCHVISION_NORM_MEAN_RGB和TORCHVISION_NORM_STD_RGB,你的代码里已经正确设置,无需修改。

内容的提问来源于stack exchange,提问作者Zack

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.04 09:44:55