如何在AWS Transcribe流式WebSocket中配置正确的说话人标签查询字符串?
问题:AWS Transcribe WebSocket添加说话人标签无效
我使用AWS Transcribe的WebSocket示例,尝试通过修改查询字符串添加说话人标签。当前WebSocket的URL查询字符串为?language-code=it-IT&media-encoding=pcm&sample-rate=16000&show-speaker-label=true&max-speaker-label=10,但返回的事件消息和未添加说话人标签时完全一致。请问正确的查询字符串应该是什么?
正确查询字符串及说明
- 你使用的参数
max-speaker-label是错误的,AWS Transcribe WebSocket API中控制最大说话人数的正确参数名是max-speakers - 修正后的完整查询字符串为:
?language-code=it-IT&media-encoding=pcm&sample-rate=16000&show-speaker-label=true&max-speakers=10 - 额外注意:需要确保你的音频流满足说话人识别的基本要求(比如清晰的人声、不同说话人有明显的声纹差异),同时确认使用的Transcribe WebSocket API版本支持说话人标签功能,否则即使参数正确也可能无法返回预期的标签信息
内容的提问来源于stack exchange,提问作者trenta3
相关产品推荐
相关产品推荐

