You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何判断两段音频的相似度?求唱歌打分功能简易实现方案

简易实现唱歌打分(音频相似度判断)方案

核心逻辑说明

唱歌打分本质不是比两段音频的“听起来像不像”,而是比用户演唱的音高、节奏和原唱的匹配度——SimHash是给文本/图片做哈希去重用的,完全抓不住音频的时序、音高变化这些核心特征,没用很正常。

具体实现步骤(轻量版)

1. 先做音频标准化

  • 把原唱和用户音频转成统一格式:单声道、16kHz采样率,用librosa或者pydub几行代码就能搞定,避免采样率/声道不同干扰后续计算。
  • 切掉静音:用能量阈值过滤掉两段音频里没声音的部分,只保留有效演唱片段。

2. 提取关键特征

重点抓音高序列和时序对齐:

  • 提取音高:用librosa.pyin()(免费轻量)或者crepe的轻量模型,把每帧音频转换成MIDI数值(比如C4对应60),这样方便做数值对比。
  • 时序对齐:用户唱的速度大概率和原唱不一样,用**动态时间规整(DTW)**把两段音高序列拉到同一时间轴上,librosa.sequence.dtw()直接调用就行,不用自己写算法。

3. 计算得分

对齐后就可以算匹配度了:

  • 音高匹配分:统计每帧对齐后的MIDI值差值,比如差值在±1以内就算匹配,算匹配帧占总帧的比例,占比越高分越高。
  • 节奏匹配分:对比对齐后每段音的持续时长,差值在20%以内就算合格,同样算占比。
  • 综合得分:把音高分(占70%)和节奏分(占30%)加权求和,就是最终的唱歌打分。

4. 可选小优化

  • 加个音量容错:对比两段音频的平均能量,要是用户音量差太多,适当调整得分权重,避免音量问题影响判断。
  • 给转音留余地:连续变化的滑音/转音,不用卡死每帧的音高,只要整体趋势和原唱一致就算匹配。

为啥SimHash不适合?

SimHash是把内容压缩成固定长度的哈希,靠汉明距离判断相似度,适合处理文本、图片这类静态内容的去重,但音频是随时间变化的连续信号,SimHash会直接丢失时序、音高变化这些核心信息,用来做唱歌打分完全不对路。

内容的提问来源于stack exchange,提问作者afei

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.19 20:05:26