You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于深度学习模型特征提取结果及model.predict返回值播放音频

从深度学习模型输出播放音频的方法

不管是模型的特征提取结果,还是model.predict()的返回值,只要处理成符合要求的音频格式,就能直接播放,步骤如下:

核心步骤

  • 获取模型输出:先拿到模型返回的特征或预测结果数组,比如features_test = model.predict(X_test)。
  • 调整数组形状:音频播放需要一维的采样数组(单声道),所以要根据模型输出的维度做调整。比如你的模型输出是(样本数, 时间步长, 通道数),就取单个样本的对应通道数据,转换成一维数组。
  • 调用播放工具:用IPython的Audio类传入处理后的数组和正确的采样率即可。

代码示例(优化版)

import numpy as np
from IPython.display import Audio

# 获取模型的预测/特征提取结果
features_test = model.predict(X_test)

# 提取第一个样本的音频数据(根据你的模型输出维度调整索引)
# 假设输出维度是 (N_samples, time_steps, n_channels)
audio_data = features_test[0, :, 0]  # 取第1个样本、所有时间步、第1个通道的一维数据

# 播放音频,rate要和原始音频的采样率一致(比如16000Hz)
Audio(audio_data, rate=16000, autoplay=False)

关键注意事项

  • 采样率rate必须和你训练数据中音频的采样率完全一致,否则播放的音频会出现速度、音调异常。
  • 如果模型输出的是压缩特征(比如梅尔频谱、MFCC),不能直接播放,需要先做逆变换还原成原始波形(比如逆梅尔变换),再按上述步骤处理。只有当模型输出是原始音频波形的预测结果时,才能直接调整维度播放。

内容的提问来源于stack exchange,提问作者Alessandro

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.08 18:35:16