You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Web Speech API运行机制、数据保护问题及本地/自托管替代方案咨询

Web Speech API 运行逻辑说明

你示例的调用代码是Web Speech API的标准前端写法:

var SpeechRecognition = SpeechRecognition || webkitSpeechRecognition
var recognition = new SpeechRecognition();
recognition.onresult = [...]

Chrome 中对该 API 的实现 默认不是本地执行的:你提到的离线字幕生成是Chrome无障碍功能的专属本地组件,和开放给网页调用的Web Speech API是两套独立逻辑,后者的识别计算确实由谷歌服务器完成。相关数据传输规则可参考公开说明:

Chrome支持Web Speech API,这是一种在网页上实现语音转文字的机制。它使用谷歌的服务器执行转换,使用该功能时会将音频录制内容发送给谷歌(音频数据不会直接发送给网页本身),同时发送的还有调用该API的网站域名、您的浏览器默认语言以及网站的语言设置。这些请求不会附带Cookie。

至于无公开速率限制的问题,Web Speech API面向的是普通网页的轻量使用场景,和谷歌付费语音识别服务面向企业级高并发、定制需求的定位不同,二者产品逻辑并不冲突,只是高频调用会触发未公开的隐形限制,不适合公共项目的稳定使用。

本地可运行/自托管替代方案

如果需要完全掌握数据流向,可选择以下开源方案:

  • 浏览器端纯本地运行:使用vosk-browser,是Vosk语音识别库的WebAssembly编译版本,所有识别逻辑完全在用户浏览器端执行,不需要上传任何音频数据,轻量模型体积仅几MB,支持数十种常用语言。
  • 自托管后端方案:
    • Vosk:开源离线语音识别工具,支持多语言、多平台部署,可自行搭建后端服务,所有音频数据仅在你自己的服务链路内流转
    • Whisper:OpenAI开源的语音识别模型,识别准确率更高,支持上百种语言和方言,可基于该模型自行封装API供前端调用
    • Coqui STT:开源端到端语音识别工具,支持自定义训练专属模型,适合有特定场景识别需求的项目使用

内容的提问来源于stack exchange,提问作者salbeira

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.05 16:06:02