MacOS High Sierra下本地wav/mp3音频转文字简便解决方案咨询
适用于macOS High Sierra的本地离线语音转文字方案
首选方案:whisper.cpp
- 这是OpenAI Whisper的C/C++移植版本,完全离线运行无联网需求,无内置收费,支持直接通过shell命令调用,原生支持对接ffmpeg管道输入,完美适配你搭配ffmpeg处理任意音频格式的需求。
- 安装门槛极低,macOS High Sierra可直接通过源码编译,无复杂依赖:拉取源码后执行
make即可生成可用二进制,将编译得到的main文件重命名为whisper放入/usr/local/bin目录即可全局调用。 - 无需提前手动转换音频格式,直接配合ffmpeg即可处理mp3、wav等绝大多数常见音频文件,示例命令:
可直接输出纯文本识别结果,也支持自定义输出为txt、srt等格式。ffmpeg -i 待识别音频.mp3 -f wav -ar 16000 -ac 1 - | whisper -m 模型文件路径 -f - - 可按需选择模型体积,
tiny、base级别的模型仅几十MB,运行速度快,对老款Mac性能压力小,识别准确率远高于Sphinx,无需手动调参或训练,开箱即用。
备选方案:预编译版PocketSphinx
- 如果你不想编译源码,可直接通过旧版brew安装预编译的PocketSphinx,安装命令:
brew install pocketsphinx。 - 调用简单,针对wav格式文件可直接执行命令识别:
配合ffmpeg转换格式即可处理mp3等其他格式文件,缺点是识别准确率低于whisper.cpp,适合对精度要求不高的场景。pocketsphinx_continuous -infile 待识别音频.wav 2>/dev/null
内容的提问来源于stack exchange,提问作者chrisroode
相关产品推荐
相关产品推荐

