You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Conversational Actions停服后,如何将智能音箱/显示屏转录语音发至服务器?

替代Conversational Actions的本地语音处理方案

针对你需要在谷歌智能音箱/显示屏上自行完成全流程语音解析、处理及响应的需求,目前有以下可行途径:

  • 开源离线语音工具链部署
    • 语音转文字(ASR):采用Vosk、Whisper.cpp这类轻量开源模型,可直接部署在设备硬件上,实现离线语音识别。
    • 意图处理与逻辑执行:使用Rasa的本地部署版本,或自定义规则引擎完成意图解析和业务逻辑处理;也可导出Dialogflow CX的模型到本地运行。
    • 文字转语音(TTS):通过eSpeak-NG、Coqui TTS的离线模型生成语音响应,全程无需依赖云端服务。
  • 第三方固件改造
    部分谷歌智能音箱/显示屏有社区开发的第三方固件(基于Linux定制),刷入后可绕过官方服务,直接对接本地语音处理栈,实现完全自主的语音交互流程。
  • Local Home SDK结合本地服务
    利用谷歌Assistant的Local Home SDK,将语音指令转发到本地服务器(如Home Assistant)进行处理,再通过SDK将响应返回给设备。这种方式虽保留Assistant唤醒,但核心逻辑可在本地完成,一定程度上替代Conversational Actions的自定义能力。

Conversational Actions的停服确实大幅限制了谷歌智能设备的自定义交互深度,若官方无后续调整,上述方案是当前实现本地全流程语音处理的主要方向。

内容的提问来源于stack exchange,提问作者mrceolla

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.17 09:15:40