You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Google语音转文字处理印地语、泰卢固语音频时漏句问题咨询

解决Google Speech-to-Text印地语/泰卢固语音频漏转录问题

核心配置调整

  • 禁用低置信度结果过滤:Google Speech-to-Text默认会隐性过滤置信度极低的片段,即便控制台未手动设置阈值。你需要在API请求中明确开启词置信度,并将置信度阈值设为0(或远低于默认值),强制返回所有识别结果。示例REST API请求参数:
    {
      "config": {
        "language_code": "hi-IN", // 泰卢固语替换为 te-IN
        "enable_word_confidence": true,
        "confidence_threshold": 0.0,
        "enable_automatic_punctuation": true
      },
      "audio": {
        "uri": "gs://your-bucket/audio-file.wav"
      }
    }
    
  • 启用通话专用模型:针对对话场景,指定phone_call模型,该模型优化了通话音频的识别逻辑,更适配印地语、泰卢固语这类语言的口语对话:
    "config": {
      "model": "phone_call",
      "language_code": "hi-IN"
    }
    

额外优化建议

  • 获取多版本转录结果:设置max_alternatives为大于1的值(如3),获取同一段音频的多个候选转录文本,避免单一结果漏句:
    "config": {
      "max_alternatives": 3
    }
    
  • 预处理音频:若漏句片段为低音量或带噪音的内容,先对音频做增益调整、降噪处理后再提交识别——Speech-to-Text会直接跳过音量过低的片段。
  • 使用异步识别:对于时长超过1分钟的音频,优先调用异步识别接口,它比同步接口的处理逻辑更稳定,能减少实时处理限制导致的漏转录。

内容的提问来源于stack exchange,提问作者Tejaswini

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.25 08:06:30