You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

语音音频中基于振幅阈值的辅音与元音自动分离实现问询

基于阈值的语音元音与辅音区域分离实现

需求说明

给定语音音频文件,其波形图中元音对应振幅较大的区域,辅音对应振幅较小的区域。需基于设定的阈值识别元音与辅音的分界点,并实现分离逻辑。

完整实现代码

# 导入依赖库
import numpy as np
import librosa
import matplotlib.pyplot as plt

# 加载音频文件,单声道模式
y, sr = librosa.load('english.wav', mono=True)

# 设置振幅阈值
threshold = 0.2

# 1. 处理音频振幅:取绝对值,消除正负影响
y_abs = np.abs(y)

# 2. 标记每个音频样本的状态:1表示元音(超过阈值),0表示辅音(低于阈值)
is_vowel = (y_abs > threshold).astype(int)

# 3. 识别分界点:找到状态发生变化的索引位置
# 计算状态变化的差分,非零值即为状态切换点
state_changes = np.where(np.diff(is_vowel) != 0)[0]

# 4. 可视化波形与分界点
plt.figure(figsize=(12, 6))
plt.plot(y, label='音频波形')
plt.axhline(y=threshold, color='r', linestyle='--', label='阈值线')
plt.axhline(y=-threshold, color='r', linestyle='--')
# 绘制绿色分界点竖线
for idx in state_changes:
    plt.axvline(x=idx, color='g', linestyle='-', label='分界点' if idx == state_changes[0] else "")
plt.legend()
plt.title('音频波形与元音/辅音分界点')
plt.xlabel('样本索引')
plt.ylabel('振幅')
plt.show()

# 5. 分离元音与辅音片段
# 初始化片段列表
vowel_segments = []
consonant_segments = []

# 遍历状态区间
start_idx = 0
for end_idx in np.append(state_changes, len(y)-1):
    segment = y[start_idx:end_idx+1]
    if is_vowel[start_idx] == 1:
        vowel_segments.append(segment)
    else:
        consonant_segments.append(segment)
    start_idx = end_idx + 1

# 输出分离结果信息
print(f"共识别到 {len(vowel_segments)} 个元音片段")
print(f"共识别到 {len(consonant_segments)} 个辅音片段")

代码说明

  • 振幅处理:音频波形是正负交替的,取绝对值后统一用阈值判断振幅大小
  • 状态标记:通过数组直接比较生成状态序列,比循环遍历更高效
  • 分界点识别:利用np.diff计算状态变化,快速定位所有切换位置
  • 可视化:绘制波形、阈值线和分界点竖线,直观展示识别结果
  • 片段分离:根据状态区间分割音频,分别存储元音和辅音片段

内容的提问来源于stack exchange,提问作者codeDom

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.19 20:05:06