You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Microsoft Azure audio-to-speech API实现说话人识别的方案咨询

Azure语音转文字实现说话人区分的实现方案

基于现有API的实现方式

你正在使用的Azure语音服务(原Speech to Text API)本身已内置说话人分割聚类(Diarization)能力,无需额外接入新API,直接调整原有调用参数即可开启:

  • 批量长音频转写场景:调用BatchTranscription接口时,在请求参数中将diarizationEnabled设为true,同时可根据场景配置diarization.speakers参数指定最大识别说话人数量(支持12人、35人两个区间选项),最终转写结果中每段内容会自动携带speakerId字段,用来区分不同的说话人。
  • 实时流转写场景:调用实时语音转文字接口时切换为conversationTranscription模式,即可自动区分不同说话人,输出结果同样携带对应的说话人标识。

提示:该能力目前仅支持简体中文、英文、西班牙语、法语、德语、意大利语、葡萄牙语、日语8种语言,输入音频为16KHz采样率的单声道音频时识别准确率最优。

其他相关API补充(如需绑定具体说话人身份)

如果你不仅需要区分不同说话人,还需要匹配到具体的人员身份,可以搭配使用Azure说话人识别API:

  • 提前为每个需要识别的说话人上传3段以上、每段不短于30秒的清晰语音样本,生成对应说话人的特征档案
  • 转写完成后将分割出的单说话人语音片段调用说话人验证接口,和已有的特征档案做比对,即可完成身份匹配。

内容的提问来源于stack exchange,提问作者Sergio Gonzales

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.07 10:30:02