人工录入Dose Area Product(DAP)数据的异常值过滤方法咨询
针对DAP数据人工录入异常值的处理方案
箱线图法的局限性
箱线图法不足以应对你的场景,核心问题如下:
- 数据为低数值偏态分布且非负,计算出的下限LL大概率为负,完全无法过滤数量级错误导致的低值异常(比如本该1000却录成1);
- 仅靠上限过滤高值异常时,偏态分布会让Q3+1.5*IQR的阈值误判大量真实高剂量数据,导致过滤过度。
更客观的统计过滤方法
结合数据偏态、非负、易出数量级错误的特点,推荐以下几种针对性方法:
1. 对数变换结合箱线图法
数量级错误本质是对数尺度上的偏移(比如1000→1,对数后差值为3),先对DAP数据做对数变换(log(DAP)),此时数据更接近正态分布,再用箱线图法计算阈值:
- 对变换后的数据计算Q1'、Q3'、IQR',得到LL'=Q1'-1.5IQR',UL'=Q3'+1.5IQR';
- 将阈值反变换回原始尺度:
LL = exp(LL'),UL = exp(UL'); - 既能过滤低值的数量级错误,也能避免偏态导致的高值异常误判。
2. 分位数法设定固定比例阈值
基于数据偏态分布,直接用分位数设定贴合实际的上下限:
- 比如取0.1%分位数作为低值异常下限,99.9%分位数作为高值异常上限;
- 比例可根据人工错误率调整,比如错误率约1%时,用0.5%和99.5%分位数;
- 完全基于数据分布,主观性极低,能覆盖数量级错误导致的极端高低值。
3. 业务规则+统计校验结合法
结合X光检查的业务逻辑缩小校验范围:
- 先统计同类型X光检查的DAP常规分布,确定该检查的合理区间(比如某部位X光的DAP通常在50-5000之间);
- 在合理区间内,用对数变换后的Z-score或分位数法做二次校验;
- 能有效区分真实高剂量异常(如特殊患者检查)和人工录入错误。
4. 相邻值校验法
若数据按检查时间/患者序列录入,可对比相邻记录:
- 计算当前记录与前N条(比如前3条)记录比值的对数,若绝对值超过阈值(比如2,对应100倍数量级差异),则标记为异常;
- 适合同一检查类型连续录入的场景,快速识别明显的数量级错误。
总结
箱线图法单独使用无法覆盖需求,建议优先尝试对数变换+箱线图或分位数法,若有业务规则支撑,结合业务区间校验会更精准。这些方法能大幅降低主观性,有效区分人工错误和真实剂量异常。
内容的提问来源于stack exchange,提问作者Huragok
相关产品推荐
相关产品推荐

