You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Android端YAMNet TFLite音频分类模型误判静音问题修复

修复YAMNet音频分类结果始终为Silence的问题

你的代码出现该问题核心原因有两个:FFmpeg音频转换未完成就读取文件,以及手动解析WAV文件时忽略了文件头导致加载无效数据。以下是具体修复方案:

1. 等待FFmpeg音频转换完成

FFmpegKit.execute()是异步执行的,原代码调用后立即读取临时文件,此时文件可能未生成或不完整,模型读取到空/无效音频后识别为静音。需改用同步执行并校验结果:

// 替换原FFmpeg执行代码,强制输出16位PCM格式并同步等待完成
val ffmpegCommand = "-i ${srcFile.absolutePath} -ar 16000 -ac 1 -c:a pcm_s16le -y ${tempFile.absolutePath}"
val session = FFmpegKit.execute(ffmpegCommand)
val returnCode = session.returnCode
if (!ReturnCode.isSuccess(returnCode)) {
    // 处理转换失败场景
    Log.e("YAMNet", "音频转换失败: ${session.failStackTrace}")
    return
}

新增-c:a pcm_s16le参数,强制输出YAMNet要求的16位PCM格式,避免格式不匹配。

2. 使用Task Audio工具类加载音频

手动读取WAV文件时容易忽略前44字节的文件头(非音频数据),导致加载错误。改用TensorFlow Lite Task Audio提供的工具类直接加载:

首先升级依赖到稳定版本(原0.2.0版本较旧):

implementation 'org.tensorflow:tensorflow-lite-task-audio:0.4.0'

替换手动读取音频的代码:

// 直接将WAV文件加载到输入张量,自动处理文件头
val audioTensor = classifier.createInputTensorAudio()
val audioFormat = classifier.requiredAudioFormat
val wavBytes = Files.readAllBytes(tempFile.toPath())
AudioUtil.wavFileToInputTensorAudio(wavBytes, audioFormat, audioTensor)

完整修正后的代码

val srcFile = File("src_file_path")
val modelFile = File("yamnet_model_path.tflite")

// 初始化分类器
val classifier = AudioClassifier.createFromFile(this, modelFile)
val audioFormat = classifier.requiredAudioFormat

// 创建临时转换文件
val tempFile = File.createTempFile(System.currentTimeMillis().toString(), ".wav")

// 同步执行音频格式转换
val ffmpegCommand = "-i ${srcFile.absolutePath} -ar ${audioFormat.sampleRate} -ac ${audioFormat.channelCount} -c:a pcm_s16le -y ${tempFile.absolutePath}"
val session = FFmpegKit.execute(ffmpegCommand)
if (!ReturnCode.isSuccess(session.returnCode)) {
    Log.e("YAMNet", "音频转换失败: ${session.failStackTrace}")
    tempFile.delete()
    return
}

// 加载转换后的音频到输入张量
val audioTensor = classifier.createInputTensorAudio()
val wavBytes = Files.readAllBytes(tempFile.toPath())
AudioUtil.wavFileToInputTensorAudio(wavBytes, audioFormat, audioTensor)

// 执行分类并输出结果
val output = classifier.classify(audioTensor)
for (category in output[0].categories) {
    Log.d("YAMNet", "分类:${category.label},置信度:${category.score}")
}

// 清理临时文件
tempFile.delete()

额外验证点

  • 确认下载的YAMNet模型文件完整无损坏
  • 测试用音频文件可正常播放,无损坏

内容的提问来源于stack exchange,提问作者M. K.

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.19 02:40:31