You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

OpenAI Whisper API无法处理移动端长时录音问题求助

移动端音频提交Whisper API只转录几秒的问题解决办法

问题根源排查

  • 移动端录制的音频格式/编码不兼容:Whisper API对音频参数有明确要求,手机默认录制的音频可能采用特殊压缩格式、采样率不匹配,或者音频容器存在异常,导致API仅能识别开头片段。
  • 音频文件损坏:手机录制过程中可能出现中断,导致文件写入不完整,API解析时提前终止。
  • 上传过程文件截断:移动端上传时网络不稳定,造成音频文件未完整传输至API服务器。

分步解决方法

1. 转换为兼容的音频格式

将移动端录制的音频转成Whisper API推荐的格式,优先选择WAV(PCM编码),并调整参数:

  • 采样率设置为16kHz(Whisper模型原生支持,兼容性最佳)
  • 声道选择单声道或立体声均可,单声道稳定性更强

使用ffmpeg转换的命令示例:

ffmpeg -i 移动端录制音频.m4a -ar 16000 -ac 1 -c:a pcm_s16le 转换后音频.wav

2. 验证音频文件完整性

用本地音频播放器完整播放移动端录制的音频,确认无卡顿、中断情况。若播放中途停止,说明录制过程存在问题,重新录制即可。

3. 确保上传过程稳定

避免直接通过移动端上传,先将音频文件传输至电脑,再使用你当前的curl命令提交,减少网络波动导致的文件截断风险。

4. 优化curl请求排查问题

添加参数让API返回更详细的信息,便于确认文件是否被完整接收:

curl --request POST \
  --url https://api.openai.com/v1/audio/transcriptions \
  --header 'Authorization: Bearer TOKEN' \
  --header 'Content-Type: multipart/form-data' \
  --form 'file=@C:\Users\katra\Desktop\转换后音频.wav' \
  --form model=whisper-1 \
  --form response_format=verbose_json

返回的verbose_json结果包含音频时长等信息,可确认API是否完整识别了文件长度。

测试验证

转换格式后用curl提交请求,对比转录内容与原音频,确认是否完整。若仍存在问题,检查转换后音频与桌面端正常音频的参数(采样率、编码、时长),确保两者一致。

内容的提问来源于stack exchange,提问作者SimplePhotos

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.10 03:15:59