You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何修改dejavu库实现录音片段在源音频中的重复次数统计

基于Dejavu修改实现音频片段重复出现次数统计的方案

Dejavu原有设计仅做存在性判定的核心原因是:它的匹配逻辑只会聚合足够数量的匹配哈希对来确认片段存在,不会区分多段独立的匹配区间,自然无法统计出现次数,可按以下步骤修改实现计数功能:

  • 保留原有音频指纹生成逻辑,新增偏移量聚类步骤
    Dejavu匹配过程中会输出所有匹配哈希对应的「源音频时间偏移」和「查询片段时间偏移」的差值,你可以将这些差值按查询片段时长的1/10作为窗口大小做聚类,同一聚类内的差值属于同一次匹配的偏移结果。
  • 新增有效匹配过滤规则
    对每一个聚类的匹配哈希数量做校验,只有数量达到Dejavu原有存在性判定的阈值(默认20个匹配对)的聚类,才判定为一次有效命中。
  • 新增重叠匹配去重逻辑
    如果两个有效聚类对应的源音频时间区间重叠度超过30%,判定为同一次识别的重复结果,仅计数1次,避免片段本身的重复特征导致多计数。
  • 适配全库统计需求
    如果需要统计查询片段在整个数据库所有源音频中的总出现次数,只需遍历所有源音频的匹配结果,累加每个源音频的有效命中次数即可,也可单独输出每个源音频内的出现次数。

调试阶段可根据实际场景调整参数:噪声较大的场景适当提高匹配哈希数量阈值,查询片段较短的场景适当降低重叠度判定阈值。如果需要更高的计数准确率,可以在匹配到对应时间区间后,新增一步频谱相似度校验,将区间内的音频频谱和查询片段的频谱做余弦相似度计算,相似度超过0.8的才计入有效次数,可大幅降低误识别概率。

内容的提问来源于stack exchange,提问作者Himanshu Chaudhary

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 03:24:03