You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Whisper base.en模型转录音频末尾出现重复词,求原因

Whisper base.en模型转录末尾出现大量重复词汇的原因分析

我使用Whisper的base.en模型处理音频文件,设置参数temperature=0,但转录结果末尾出现大量重复词汇,比如重复的"Okay""Yes"等,具体转录结果如下:

Okay. Okay. Okay. Go back. Just go to form. I hope. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Go back. Okay. Okay. Okay. Okay. Go back. Okay. Go back. There was one of those meetings where, you know, we did not get any recordings. So we need to go through those. Can you start from the 1245? Is the meeting at 1245 AM? 1245. 1245 AM. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. Okay. So 52 has not even said video. And 53, you know, 53. What is there to get 53 53. It's not just look at the test. Already the bodies are more. You can play the video. Okay. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes. Yes.

参考代码如下:

model = whisper.load_model("base.en")
outFile = fileName.split('.ogg')[0] + '.wav'
result = model.transcribe(outFile, temperature=0)
print(result['text'])

问题原因

  • temperature=0的确定性限制:当temperature设为0时,模型会严格选择概率最高的词汇,完全没有随机性。如果音频末尾存在模糊噪音、低音量重复音节,或者模型对这段内容的置信度极低,就会陷入循环,反复输出Okay、Yes这类高频语气词——因为这些词在日常对话中出现概率最高,模型会优先选择它们填充模糊内容。
  • 音频末尾的无效内容:音频文件末尾可能存在长时间静音、重复低噪,或者无意义的重复音频片段。模型试图对这些没有明确语义的内容转录,只能反复输出最常见的填充词汇。
  • base.en模型的能力局限:base.en是小参数模型,对模糊、低质量音频的处理鲁棒性较差。遇到语义不明确的片段时,更容易出现重复输出的问题,换成large.en这类大参数模型会有所改善。

内容的提问来源于stack exchange,提问作者vaibhav jain

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.05 17:35:12