TREC竞赛Pooling Method(池化法)相似模型导致相关性判断偏差疑问
你观察到的两个问题都是TREC池化评估机制的已知固有缺陷,学界统称「池化偏差」,相关优化方案已经经过了多年的迭代,对应说明如下:
关于同类模型重合度高导致相关文档覆盖不全的问题
- TREC组委会在参赛系统的遴选阶段就会刻意保障技术路线的多样性:不同检索范式(传统统计检索、深度学习检索、规则检索、领域定制检索等)的系统都会被纳入,不会出现绝大多数参赛系统均使用同类模型的极端情况。即使某一阶段某类技术成为主流,组委会也会额外加入多个不同技术路线的官方基线系统,补充池化结果的覆盖度。
- 池化深度通常设置较高:多数常规任务会取每个参赛系统返回的Top 100~Top 200结果做合并,同类模型仅在排序极靠前的结果重合度高,排名靠后的返回结果差异仍然很大,合并后的文档池足以覆盖绝大多数相关文档。已有统计验证显示,当池化深度≥100时,即使同类型模型占比超过80%,漏检的相关文档占比通常低于5%,不会对系统的相对性能排序产生显著影响。
关于评估结果受参赛模型偏好影响、无法做到检索方法无关的问题
- TREC池化机制的核心设计目标首先是保障参赛系统评估的公平性,而非构建绝对完备的相关文档集:如果一份相关文档没有被任何参赛系统召回,那么它的存在不会对所有参赛系统的得分产生影响,自然也不会干扰最终的系统性能排名。
- 如果需要支持跨技术路线的通用检索方法对比,现有公开的TREC测试集大多已经完成多轮补充标注:组委会会在初始池化结果之外,通过随机采样、主动学习等方式补充标注更多潜在相关文档,池化偏差已经被控制到极低水平,完全可以满足通用检索方法的验证需求。
内容的提问来源于stack exchange,提问作者Arup Das
相关产品推荐
相关产品推荐

