You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Speech-to-Text API技术咨询:v1与v1p1差异及Chirp模型流式支持

Speech-to-Text API 技术问题解答

1. Speech-to-Text API v1与v1p1版本的区别

  • 功能增强:v1p1是v1的迭代升级版本,新增了多项进阶功能,比如自定义模型的精细化训练控制、多通道音频的分层转录支持,以及针对医疗、金融等垂直领域的专属优化模型。
  • 参数扩展:v1p1在请求配置上新增了更多参数,比如支持更细分的词级置信度设置,以及强化的说话人分离配置项,能更精准区分不同说话人的语音内容。
  • 性能提升:相比v1,v1p1在长音频处理效率上有明显优化,同时对低信噪比、带背景噪音的音频识别准确率更高。
  • 支持优先级:新地区、新语言的识别支持通常会先在v1p1中上线,后续才会逐步同步到v1版本。

2. Speech-to-Text v2中Chirp模型是否支持流式输入音频转录

Chirp模型完全支持流式输入音频的转录。它专门针对流式场景做了优化,能够在音频持续输入的过程中实时返回转录结果,延迟更低,同时保持高识别准确率,非常适合实时会议字幕、实时语音助手交互这类需要低延迟转写的场景。

内容的提问来源于stack exchange,提问作者seriously

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.26 22:14:52