纵向队列缺失数据用线性混合模型拟合是否需删除高缺失率波次
线性混合效应模型高缺失率波次处理解答
核心结论
在严格满足MCAR(完全随机缺失)或MAR(随机缺失)的假设前提下,你不需要删除Wave6的观测值,也不需要主动删除任何高缺失率波次来避免估计偏倚,保留这类波次的有效观测反而能提升模型参数的估计效率。
具体解释
- 你使用的是
lmer的最大似然估计(REML=F),这类估计方法在MAR/MCAR假设下本身就能得到无偏的参数估计,核心逻辑是估计过程会自动利用所有可用的观测信息,不会因为某一波次整体缺失率高就对现有观测赋予有偏的权重,只要单条观测的缺失符合随机假设,就是有效信息。 - 你提到Wave6的缺失大部分来自数据收集未完成,这类缺失本身是典型的MCAR场景:缺失概率仅和波次的收集进度有关,和受试者的结局值、协变量特征都没有关联,缺失假设的合理性比主动失访场景更高,保留这67条观测完全不存在偏倚风险。
- 主动删除Wave6反而会带来负面影响:你模型中纳入了年龄的一次项、二次项和PRS、APOE的三重交互,高波次的观测刚好能为年龄非线性效应的拟合提供更充分的极值信息,删除后不仅会损失样本量,还会拉低参数估计的精度,导致标准误变大。
补充注意事项
- 建议做敏感性分析验证结果稳健性:你可以分别拟合保留Wave6和删除Wave6的两个模型,对比核心参数(也就是PRS_Kunkle和年龄、APOE的交互项)的效应值和显著性,如果差异极小,就说明结果不受这部分小样本的影响;如果差异很大,就要考虑是否存在MNAR(非随机缺失)的可能,比如完成Wave6随访的受试者本身存在系统性的特征差异,这种情况下可以进一步调整控制变量,或者配合多重插补方法优化估计。
- 你现有代码中已经纳入了波次变量
VisNo作为协变量,相当于已经控制了波次层面的系统性差异,刚好适配你这种按波次产生缺失的场景,不需要额外调整核心模型结构。 - 如果担心Wave6样本量过小带来的异常值影响,可以额外在模型中加入Wave6的指示变量,或者使用稳健标准误调整估计,进一步降低极端值的干扰。
内容的提问来源于stack exchange,提问作者zjppdozen
相关产品推荐
相关产品推荐

