开源批量离线语音转文本(STT)模型选型咨询
开源离线批量STT模型推荐
针对你关注的长音频WER、单GPU吞吐量、语言覆盖、词级时间戳及说话人分离需求,推荐以下模型:
1. Whisper (OpenAI)
- 长音频WER:英文场景表现顶尖,Large V2/V3版本对电话、会议这类带噪音/口音的长音频WER控制出色;多语言版本支持近100种语言,非英文也有可靠基线表现。
- 单GPU吞吐量(RTF):A100上处理长音频的RTF可达0.01-0.03,L4/A10上能稳定在0.05以内,批量处理时可进一步压缩耗时。
- 语言覆盖:多语言(近100种),也可选用英文专用模型。
- 词级时间戳:原生支持,输出自带每个词的起始/结束时间戳。
- 说话人分离:原生不支持,但可轻松搭配pyannote.audio等开源工具实现,生态成熟,有大量现成流水线脚本。
2. Conformer-CTC (NVIDIA NeMo)
- 长音频WER:NVIDIA针对会议、电话场景优化的预训练模型(如NeMo ASR Conformer Large),英文WER在低信噪比电话音频场景优于Whisper,精准度更高。
- 单GPU吞吐量(RTF):A100上RTF可达0.008-0.02,L4/A10上表现优于Whisper,模型针对CUDA深度优化,批量推理效率拉满。
- 语言覆盖:支持英文及数十种主流语言,可通过微调扩展更多语种。
- 词级时间戳:通过官方配套的CTC对齐工具可生成精准词级时间戳。
- 说话人分离:NeMo生态内置说话人识别/分离模块,可直接整合进流水线,无需额外第三方工具。
3. FunASR (阿里巴巴达摩院)
- 长音频WER:中英预训练模型在会议、播客场景WER表现优秀,中文长音频处理精度突出;支持自动分段处理长音频,避免性能衰减。
- 单GPU吞吐量(RTF):A100上RTF可达0.01-0.025,L4/A10上优化后能到0.04左右,支持TensorRT加速,批量推理效率高。
- 语言覆盖:多语言(中英为主,支持东南亚、欧洲等十余种语言)。
- 词级时间戳:原生支持,输出格式友好,可直接用于字幕生成。
- 说话人分离:内置说话人分离接口,支持多说话人离线场景处理,无需额外集成。
4. Wav2Vec2.0 (Facebook)
- 长音频WER:英文Large 960h预训练模型在干净播客场景WER极低,对轻微口音音频表现稳定;可通过微调适配电话/会议的噪音场景。
- 单GPU吞吐量(RTF):A100上RTF约0.02-0.04,L4/A10上略低于Whisper,但批量处理时可通过音频拼接进一步提升效率。
- 语言覆盖:支持英文及多种语言,社区有大量微调后的多语言模型。
- 词级时间戳:需借助ctc-segmentation等外部工具生成,社区有成熟实现方案。
- 说话人分离:需搭配pyannote.audio等第三方工具,整合难度低。
内容的提问来源于stack exchange,提问作者Francisco Durán
相关产品推荐
相关产品推荐

