Azure Blob存储触发函数实现音频转文本:AudioConfig无法直接使用Blob URI的解决方案求助
解决方案:直接从Azure Blob流创建Speech SDK音频输入
我之前也踩过这个坑——不想把Blob里的音频下载到本地,直接用流来做语音转文本。其实Speech SDK支持通过AudioInputStream处理流式音频,我们可以把Azure Blob的下载流直接包装成符合要求的输入流,具体步骤如下:
步骤1:安装依赖包
除了Speech SDK,还需要Azure Blob存储的SDK,执行以下命令安装:
pip install azure-cognitiveservices-speech azure-storage-blob
步骤2:完整代码实现
下面的代码会直接从Blob存储读取音频流,无需本地存储:
import azure.cognitiveservices.speech as speechsdk from azure.storage.blob import BlobServiceClient from io import BytesIO # 配置参数 speech_key = "你的Speech服务密钥" service_region = "你的服务区域(比如westeurope)" connection_string = "你的Blob存储连接字符串" container_name = "Blob容器名称" blob_name = "目标WAV音频文件名称" # 1. 获取Blob的音频流 blob_service_client = BlobServiceClient.from_connection_string(connection_string) blob_client = blob_service_client.get_blob_client(container=container_name, blob=blob_name) # 将Blob内容读取到内存流中 audio_stream = BytesIO() download_stream = blob_client.download_blob() download_stream.readinto(audio_stream) audio_stream.seek(0) # 重置流的指针到开头 # 2. 将内存流转换成Speech SDK的AudioInputStream def stream_callback(input_stream, size): return audio_stream.read(size) # 创建PullAudioInputStream,Speech SDK会按需通过回调读取流数据 pull_stream = speechsdk.audio.PullAudioInputStream(callback=stream_callback) audio_input = speechsdk.audio.AudioConfig(stream=pull_stream) # 3. 执行语音识别 speech_config = speechsdk.SpeechConfig(subscription=speech_key, region=service_region) speech_recognizer = speechsdk.SpeechRecognizer(speech_config, audio_input) result = speech_recognizer.recognize_once() # 处理识别结果 if result.reason == speechsdk.ResultReason.RecognizedSpeech: print("识别结果: {}".format(result.text)) elif result.reason == speechsdk.ResultReason.NoMatch: print("未识别到语音: {}".format(result.no_match_details)) elif result.reason == speechsdk.ResultReason.Canceled: cancellation_details = result.cancellation_details print("语音识别被取消: {}".format(cancellation_details.reason)) if cancellation_details.reason == speechsdk.CancellationReason.Error: print("错误详情: {}".format(cancellation_details.error_details))
关键说明
- 流式处理逻辑:通过
PullAudioInputStream的回调函数,Speech SDK会按需从Blob的内存流中读取音频数据,即使是大文件也能有效节省内存。 - 权限优化:如果你的Azure Function使用托管身份访问Blob存储,可以不用连接字符串,改用
DefaultAzureCredential获取Blob客户端,安全性更高。 - 格式要求:确保你的WAV文件符合Speech SDK规范,比如PCM编码、16kHz采样率、单声道等,否则可能出现识别失败。
Azure Function场景优化
如果是在Azure Function中运行,还可以:
- 直接从Blob触发事件的上下文里获取Blob客户端,避免重复初始化
BlobServiceClient - 使用异步版本的Speech SDK和Blob SDK,提升Function的并发处理性能
内容的提问来源于stack exchange,提问作者Chace Lorans
相关产品推荐
相关产品推荐

