You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

结合线程与asyncio实现WebSocket连接下音频流实时转写的技术问询

结合线程与asyncio实现WebSocket连接下音频流实时转写的技术问询

Overview

我现在碰到这么个需求场景:我的服务器通过WebSocket和一款安卓客户端维持着开放连接,这个安卓App会实时发送麦克风采集到的音频数据。服务器收到这些数据后,需要调用谷歌语音转文字API生成实时部分转录结果,再回传给客户端,让用户能看到自己说的话被实时转写出来。

我当然清楚安卓本身自带的语音识别就能实现一模一样的效果,但现在就是要基于服务器端的方案来落地。

我的服务器是用asyncio.run()启动的,所有处理 incoming 数据的处理器都采用异步方法,下面是负责接收音频帧的代码片段:

elif action == util.ActionMessages.AUDIO_FRAME:
    audio_id, audio = content["id"], content["audio"]
    await self._audio_handler.receive_audio(audio, audio_id)

对应的音频处理器方法结构如下:

# Audio handler method
class AudioHandler:
    def __init__(...):
        # 初始化逻辑(原内容未完整展示)

备注:内容来源于stack exchange,提问作者thomaoc

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.16 08:27:59