使用Google Cloud语音转文本时遇-83104内部服务器错误求助
解决Whisper long模型转录长音频失败的问题
针对你用Whisper转录45分钟MP3时long模型失效的情况,给你几个实用排查和解决方向:
- 检查内存占用:long模型对显存/内存要求远高于video模型,45分钟音频加载后极易触发内存溢出(OOM)。可以:
- 用系统任务管理器(Windows)或
htop(Linux)实时监控内存使用,确认是否溢出 - 启用量化模式,启动时添加参数
--model_type long --load-in-8bit或--load-in-4bit,大幅降低内存占用
- 用系统任务管理器(Windows)或
- 拆分音频片段:如果内存问题无法解决,手动把45分钟MP3拆成多个10-15分钟的小片段,用long模型分别转录后合并结果。用ffmpeg拆分的命令:
ffmpeg -i input.mp3 -f segment -segment_time 900 -c copy output_%03d.mp3 - 核对模型文件完整性:long模型文件体积更大,可能存在下载不完整的情况。找到Whisper默认模型存储目录(
~/.cache/whisper),删除long.pt后重新下载 - 调整转录参数:尝试添加
--no_speech_threshold 0.6或--logprob_threshold -1.0,减少模型对静音片段的误判,避免中途崩溃 - 转换音频格式:部分编码异常的MP3可能导致long模型解析出错,先转成WAV格式再试:
ffmpeg -i input.mp3 -acodec pcm_s16le -ar 16000 output.wav
内容的提问来源于stack exchange,提问作者Fab49er
相关产品推荐
相关产品推荐

