You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Whisper.transcribe处理字节变量中的OGG音频

解决方案

无需将音频字节写入本地文件,直接借助Whisper内置的load_audio函数处理字节流即可,它会完成音频解码和格式转换,得到transcribe所需的numpy数组。

优化后的代码

import whisper
import io

# 从Matrix服务器下载OGG音频字节
audio_bytes = await self.client.download_media(evt.content.url)

# 加载Whisper模型
model = whisper.load_model("base")

# 将字节包装为文件类对象,通过load_audio解码得到符合要求的numpy数组
audio_np = whisper.load_audio(io.BytesIO(audio_bytes))

# 直接传入numpy数组完成转录
result = model.transcribe(audio_np)

原理说明

你之前直接将字节转为numpy数组无效,是因为下载的字节是压缩后的OGG格式数据,并非Whisper要求的原始PCM音频(单通道、16kHz采样率的浮点数组)。whisper.load_audio内部会调用FFmpeg处理音频解码、格式转换,既支持文件路径,也兼容BytesIO这类文件类对象,完美跳过本地文件写入步骤。

内容的提问来源于stack exchange,提问作者Tupsi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.07 03:01:14