You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何搭建支持多呼叫方音频独立流传输的会议通话以实现无Diarize实时转录

多呼叫方独立音频流式传输的会议系统搭建

完全可以搭建这类系统,核心是实现单参会者单音频流的独立传输与处理:

  • 协议选型:优先用WebRTC,每个参会者通过独立的PeerConnection向媒体服务器传输自身的音频MediaStream;也可基于SIP+RTP,为每个呼叫方分配专属RTP会话,避免流混音。
  • 媒体服务器架构:部署Janus、Kurento这类开源媒体服务器,服务器会为每个接入的音频流分配唯一会话ID,支持对单流单独做降噪、增益调节等预处理,后续可按需选择混音转发给其他参会者,或仅保留单流用于转录。
  • 客户端实现:Web端通过getUserMedia获取本地音频流,直接通过WebRTC推流;移动端用原生WebRTC SDK或SIP客户端,确保本地不提前混音,只发送自身音频流。
无需说话人分音(Diarization)的实时会议转录方案

基于上述独立流架构,完全可以绕过Diarization实现精准实时转录:

  • 单流独立转录:每个参会者的音频流单独接入ASR(自动语音识别)服务,转录结果直接绑定该参会者的身份标识(如用户ID、会话ID),天然区分不同说话人的内容,无需额外做说话人分离。
  • ASR引擎选择:用支持流式实时转录的引擎,比如Whisper的流式部署版本,或本地部署PaddleSpeech、FunASR这类开源ASR服务,为每个独立音频流分配一个转录实例,低延迟输出带身份标识的文本。
  • 结果聚合:服务器端收集所有单流的转录结果,按时间戳排序后合并展示,由于每条结果都自带说话人标识,无需Diarization就能清晰区分发言归属。

额外注意事项

  • 带宽优化:参会者较多时,可在客户端做轻量降噪、降采样处理,减少传输数据量;服务器端也可根据场景动态调整流的编码参数。
  • 时间同步:服务器端用统一时钟校准各流的时间偏移,确保聚合后的转录结果时间线准确。

内容的提问来源于stack exchange,提问作者Jeff Arnold

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.15 21:27:38