使用Microsoft Azure audio-to-speech API实现说话人识别的方案咨询
Azure语音转文字实现说话人区分的实现方案
基于现有API的实现方式
你正在使用的Azure语音服务(原Speech to Text API)本身已内置说话人分割聚类(Diarization)能力,无需额外接入新API,直接调整原有调用参数即可开启:
- 批量长音频转写场景:调用
BatchTranscription接口时,在请求参数中将diarizationEnabled设为true,同时可根据场景配置diarization.speakers参数指定最大识别说话人数量(支持12人、35人两个区间选项),最终转写结果中每段内容会自动携带speakerId字段,用来区分不同的说话人。 - 实时流转写场景:调用实时语音转文字接口时切换为
conversationTranscription模式,即可自动区分不同说话人,输出结果同样携带对应的说话人标识。
提示:该能力目前仅支持简体中文、英文、西班牙语、法语、德语、意大利语、葡萄牙语、日语8种语言,输入音频为16KHz采样率的单声道音频时识别准确率最优。
其他相关API补充(如需绑定具体说话人身份)
如果你不仅需要区分不同说话人,还需要匹配到具体的人员身份,可以搭配使用Azure说话人识别API:
- 提前为每个需要识别的说话人上传3段以上、每段不短于30秒的清晰语音样本,生成对应说话人的特征档案
- 转写完成后将分割出的单说话人语音片段调用说话人验证接口,和已有的特征档案做比对,即可完成身份匹配。
内容的提问来源于stack exchange,提问作者Sergio Gonzales
相关产品推荐
相关产品推荐

