You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Google Cloud语音转文本时遇-83104内部服务器错误求助

解决Whisper long模型转录长音频失败的问题

针对你用Whisper转录45分钟MP3时long模型失效的情况,给你几个实用排查和解决方向:

  • 检查内存占用:long模型对显存/内存要求远高于video模型,45分钟音频加载后极易触发内存溢出(OOM)。可以:
    • 用系统任务管理器(Windows)或htop(Linux)实时监控内存使用,确认是否溢出
    • 启用量化模式,启动时添加参数 --model_type long --load-in-8bit 或 --load-in-4bit,大幅降低内存占用
  • 拆分音频片段:如果内存问题无法解决,手动把45分钟MP3拆成多个10-15分钟的小片段,用long模型分别转录后合并结果。用ffmpeg拆分的命令:
    ffmpeg -i input.mp3 -f segment -segment_time 900 -c copy output_%03d.mp3
    
  • 核对模型文件完整性:long模型文件体积更大,可能存在下载不完整的情况。找到Whisper默认模型存储目录(~/.cache/whisper),删除long.pt后重新下载
  • 调整转录参数:尝试添加--no_speech_threshold 0.6或--logprob_threshold -1.0,减少模型对静音片段的误判,避免中途崩溃
  • 转换音频格式:部分编码异常的MP3可能导致long模型解析出错,先转成WAV格式再试:
    ffmpeg -i input.mp3 -acodec pcm_s16le -ar 16000 output.wav
    

内容的提问来源于stack exchange,提问作者Fab49er

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.02 10:32:03