You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

无金标准下新型评估工具的精密度指标及样本量计算咨询

重复测量精密度的最优指标与样本量计算建议

嘿,我来帮你拆解这个问题——你现在要评估一个连续型、分布未知的变量的重复性,没有金标准,每个受试者只有两次无干预的重复测量,理想状态下结果应该一致,对吧?下面是针对你的需求的具体建议:

一、最优精密度指标(仅关注重复性)

因为你的变量分布未知,而且没有金标准,非参数的一致性指标是最稳妥的选择,这里优先推荐两个:

1. Bland-Altman 95%一致性界限(LoA)

这绝对是你这种场景下的首选:

  • 它不需要假设数据服从任何分布,完全基于两次测量的差值来计算:先算所有受试者两次测量差值的中位数(代表平均偏倚,理想情况下应该接近0),再取差值的第2.5和97.5百分位数作为95%一致性界限。
  • 直观性拉满:它能直接告诉你“95%的情况下,同一个受试者的两次测量差异不会超过[X, Y]这个范围”,完美贴合你“体现重复性”的核心需求。

2. 重复差值的中位数绝对偏差(MAD)

如果需要一个更简洁的数值来代表典型的重复差异大小:

  • 计算所有受试者两次测量差值的绝对值的中位数,这个指标极端稳健,完全不受 outliers(极端值)的影响,对于分布未知的数据非常友好。

相比之下,组内相关系数(ICC)虽然常用,但它更多反映的是两次测量的相关性,而非直接的差异大小,对于你要的“结果一致程度”来说,不如上面两个指标直接。

二、所需受试者数量计算

样本量的核心需求是让你的精密度指标估计足够可靠,因为分布未知,我们只能基于稳健估计来推导:

针对Bland-Altman LoA的样本量

  • 如果有预实验数据:先拿到预实验中差值的四分位距(IQR),然后用这个公式计算:
    n = (1.96 * 1.35 * IQR / d)^2
    这里的d是你能接受的95%LoA置信区间的半宽度(也就是你能容忍的LoA估计误差),1.35是把IQR转换为稳健标准差的系数,适合未知分布的场景。
  • 如果没有预实验数据:先做20-30个受试者的预实验来获取差值的IQR;如果直接估算,至少需要50个受试者才能让第2.5/97.5百分位数的估计有基本精度,要是想让结果更稳健,建议80-100个受试者。

针对重复差值MAD的样本量

  • 要得到稳定的MAD估计,30个受试者以上就能满足基本需求;如果需要更窄的置信区间,建议60个以上的样本量。

另外提醒一句:因为变量分布未知,所有样本量计算都是偏保守的稳健估计,实际操作中如果能先做小样本预实验,再调整最终样本量,结果会更可靠。

内容的提问来源于stack exchange,提问作者Graeme

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 10:45:44