You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何评估自动语音识别(ASR)输出的命名实体识别效果?

ASR系统命名实体识别效果评估方法的合理性与补充考量

基础方法的合理性

你的核心思路是可行的:在假设NER API完全准确的前提下,通过分别提取参考文本(金标准)和ASR输出中的实体列表,再对比计算精准率、召回率,确实能直接反映ASR系统在传递命名实体上的表现——因为API的准确性已经被排除,所有差异都来自ASR的转写错误。

需要补充考量的细节

  • 实体类型必须匹配:不能只对比实体文本内容,还要验证实体的类型是否一致。比如参考文本中"Apple"被识别为[ORG],但ASR输出里的"Apple"被API识别为[PRODUCT],哪怕文本完全相同,也不能算作真阳性,这属于ASR转写导致的实体语义偏差。
  • 严格区分实体边界:如果参考文本中的实体是完整的"New York City"(一个[GPE]实体),但ASR输出成"New York",API识别出的实体缺失了部分内容,这要算假阴性;反之ASR输出多了冗余内容导致API识别出更大的实体(比如"New York City Center"),则属于假阳性。
  • 重复实体的计数逻辑:如果参考文本中多次出现同一实体(比如两次提到"Google"),ASR输出只识别到一次,要记1个假阴性;如果ASR输出多识别了一次,记1个假阳性。不能只对比实体的集合,要按实体的出现次数来统计。
  • 极端场景的覆盖:如果参考文本没有任何命名实体,但ASR输出被API识别出实体,要算假阳性;如果参考文本有实体,但ASR输出完全没对应上,要算假阴性,这类场景不能遗漏。
  • 同音错误的特殊处理(可选):你提到要求完全匹配所以没做归一化,但ASR常见同音转写错误(比如"Amazon"写成"Amazone"),如果业务场景允许,可以针对性加入同音词映射表做匹配,但前提是不违背你"完全匹配"的要求。
  • 实体位置的辅助分析:虽然实体缺失或拼写不同时位置没用,但当实体文本部分匹配时,位置可以辅助判断是否为同一实体的转写错误。比如参考实体在文本第10-15字符,ASR输出的相似实体也在相近位置,大概率是ASR转写偏差,这能帮助你分析错误类型,但不影响核心的精准率、召回率计算。

内容的提问来源于stack exchange,提问作者tripala

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 22:07:14