You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从.NET MAUI CommunityToolkit离线SpeechToText获取原始音频数据?

能否从.NET MAUI CommunityToolkit的SpeechToText中提取原始音频数据?

当前版本的.NET MAUI CommunityToolkit的ISpeechToText/OfflineSpeechToText并未直接提供获取原始音频流的API,它的核心设计目标是输出语音转文本的结果,而非暴露底层音频数据。不过你可以通过以下两种方案实现需求:

方案1:独立捕获音频流,并行处理STT与AI分析

直接使用.NET MAUI原生音频录制API(或第三方专业音频库)捕获原始音频数据,再将数据同时传入你的AI分析库,以及CommunityToolkit的SpeechToText组件(如果仍需要语音转文本功能)。

示例思路(伪代码):

// 初始化原生音频录制器,用于获取原始音频字节流
var audioRecorder = AudioRecorder.Default;
audioRecorder.RecordingDataReceived += (sender, args) =>
{
    // 将原始音频数据传入AI库处理
    YourAIModel.ProcessRawAudio(args.AudioData);
};

// 启动音频录制
await audioRecorder.StartRecordingAsync();

// 同时启动CommunityToolkit的离线语音转文本
await speechToText.StartListenAsync(new SpeechToTextOptions
{
    Culture = CultureInfo.CurrentCulture,
    ShouldReportPartialResults = true
}, CancellationToken.None);

方案2:扩展CommunityToolkit的SpeechToText实现

如果必须基于现有CommunityToolkit的STT组件,你可以参考其开源代码,对各平台的原生实现进行扩展:

  • 在Android平台,修改SpeechRecognizer相关逻辑,添加原始音频数据的回调
  • 在iOS平台,通过SFSpeechRecognitionEngine的代理方法捕获音频数据
  • 自定义实现ISpeechToText接口,新增AudioDataReceived事件,在捕获到原始音频时触发,供AI库订阅

补充提示

  • 若你此前已实现唤醒词检测,大概率已经在使用音频录制组件,直接复用该组件的音频流即可,无需依赖STT组件的音频数据
  • 注意匹配AI库要求的音频格式:多数AI模型需要特定的采样率(如16kHz)、位深(如16bit)、声道数(如单声道),确保录制的音频参数符合要求

内容的提问来源于stack exchange,提问作者Gratzy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.12 16:35:58