You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Blob存储触发函数实现音频转文本:AudioConfig无法直接使用Blob URI的解决方案求助

解决方案:直接从Azure Blob流创建Speech SDK音频输入

我之前也踩过这个坑——不想把Blob里的音频下载到本地,直接用流来做语音转文本。其实Speech SDK支持通过AudioInputStream处理流式音频,我们可以把Azure Blob的下载流直接包装成符合要求的输入流,具体步骤如下:

步骤1:安装依赖包

除了Speech SDK,还需要Azure Blob存储的SDK,执行以下命令安装:

pip install azure-cognitiveservices-speech azure-storage-blob

步骤2:完整代码实现

下面的代码会直接从Blob存储读取音频流,无需本地存储:

import azure.cognitiveservices.speech as speechsdk
from azure.storage.blob import BlobServiceClient
from io import BytesIO

# 配置参数
speech_key = "你的Speech服务密钥"
service_region = "你的服务区域(比如westeurope)"
connection_string = "你的Blob存储连接字符串"
container_name = "Blob容器名称"
blob_name = "目标WAV音频文件名称"

# 1. 获取Blob的音频流
blob_service_client = BlobServiceClient.from_connection_string(connection_string)
blob_client = blob_service_client.get_blob_client(container=container_name, blob=blob_name)

# 将Blob内容读取到内存流中
audio_stream = BytesIO()
download_stream = blob_client.download_blob()
download_stream.readinto(audio_stream)
audio_stream.seek(0)  # 重置流的指针到开头

# 2. 将内存流转换成Speech SDK的AudioInputStream
def stream_callback(input_stream, size):
    return audio_stream.read(size)

# 创建PullAudioInputStream,Speech SDK会按需通过回调读取流数据
pull_stream = speechsdk.audio.PullAudioInputStream(callback=stream_callback)
audio_input = speechsdk.audio.AudioConfig(stream=pull_stream)

# 3. 执行语音识别
speech_config = speechsdk.SpeechConfig(subscription=speech_key, region=service_region)
speech_recognizer = speechsdk.SpeechRecognizer(speech_config, audio_input)

result = speech_recognizer.recognize_once()

# 处理识别结果
if result.reason == speechsdk.ResultReason.RecognizedSpeech:
    print("识别结果: {}".format(result.text))
elif result.reason == speechsdk.ResultReason.NoMatch:
    print("未识别到语音: {}".format(result.no_match_details))
elif result.reason == speechsdk.ResultReason.Canceled:
    cancellation_details = result.cancellation_details
    print("语音识别被取消: {}".format(cancellation_details.reason))
    if cancellation_details.reason == speechsdk.CancellationReason.Error:
        print("错误详情: {}".format(cancellation_details.error_details))

关键说明

  • 流式处理逻辑:通过PullAudioInputStream的回调函数,Speech SDK会按需从Blob的内存流中读取音频数据,即使是大文件也能有效节省内存。
  • 权限优化:如果你的Azure Function使用托管身份访问Blob存储,可以不用连接字符串,改用DefaultAzureCredential获取Blob客户端,安全性更高。
  • 格式要求:确保你的WAV文件符合Speech SDK规范,比如PCM编码、16kHz采样率、单声道等,否则可能出现识别失败。

Azure Function场景优化

如果是在Azure Function中运行,还可以:

  • 直接从Blob触发事件的上下文里获取Blob客户端,避免重复初始化BlobServiceClient
  • 使用异步版本的Speech SDK和Blob SDK,提升Function的并发处理性能

内容的提问来源于stack exchange,提问作者Chace Lorans

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.30 03:13:12