You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

人工录入Dose Area Product(DAP)数据的异常值过滤方法咨询

针对DAP数据人工录入异常值的处理方案

箱线图法的局限性

箱线图法不足以应对你的场景,核心问题如下:

  • 数据为低数值偏态分布且非负,计算出的下限LL大概率为负,完全无法过滤数量级错误导致的低值异常(比如本该1000却录成1);
  • 仅靠上限过滤高值异常时,偏态分布会让Q3+1.5*IQR的阈值误判大量真实高剂量数据,导致过滤过度。

更客观的统计过滤方法

结合数据偏态、非负、易出数量级错误的特点,推荐以下几种针对性方法:

1. 对数变换结合箱线图法

数量级错误本质是对数尺度上的偏移(比如1000→1,对数后差值为3),先对DAP数据做对数变换(log(DAP)),此时数据更接近正态分布,再用箱线图法计算阈值:

  • 对变换后的数据计算Q1'、Q3'、IQR',得到LL'=Q1'-1.5IQR',UL'=Q3'+1.5IQR';
  • 将阈值反变换回原始尺度:LL = exp(LL'),UL = exp(UL');
  • 既能过滤低值的数量级错误,也能避免偏态导致的高值异常误判。

2. 分位数法设定固定比例阈值

基于数据偏态分布,直接用分位数设定贴合实际的上下限:

  • 比如取0.1%分位数作为低值异常下限,99.9%分位数作为高值异常上限;
  • 比例可根据人工错误率调整,比如错误率约1%时,用0.5%和99.5%分位数;
  • 完全基于数据分布,主观性极低,能覆盖数量级错误导致的极端高低值。

3. 业务规则+统计校验结合法

结合X光检查的业务逻辑缩小校验范围:

  • 先统计同类型X光检查的DAP常规分布,确定该检查的合理区间(比如某部位X光的DAP通常在50-5000之间);
  • 在合理区间内,用对数变换后的Z-score或分位数法做二次校验;
  • 能有效区分真实高剂量异常(如特殊患者检查)和人工录入错误。

4. 相邻值校验法

若数据按检查时间/患者序列录入,可对比相邻记录:

  • 计算当前记录与前N条(比如前3条)记录比值的对数,若绝对值超过阈值(比如2,对应100倍数量级差异),则标记为异常;
  • 适合同一检查类型连续录入的场景,快速识别明显的数量级错误。

总结

箱线图法单独使用无法覆盖需求,建议优先尝试对数变换+箱线图或分位数法,若有业务规则支撑,结合业务区间校验会更精准。这些方法能大幅降低主观性,有效区分人工错误和真实剂量异常。

内容的提问来源于stack exchange,提问作者Huragok

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.16 01:00:09