sjmisc::merge_imputations()取平均存疑,其适用场景为何?
sjmisc::merge_imputations()的合理场景 首先必须明确:正如Stef van Buuren在《5.1.2 不推荐的工作流:对数据取平均》中警告的,合并插补数据集会忽略插补间的变异性,绝大多数需要统计推断的场景下,都应该优先使用mice::with() + mice::pool()的标准多插补工作流。但sjmisc::merge_imputations()并非完全没有适用场景,以下是几种可以考虑使用它的情况:
探索性数据分析(EDA)阶段
当你只是想快速观察插补后数据的整体分布、变量间关联(比如绘制直方图、散点图,或者计算简单的描述性统计量),不需要进行严谨的统计推断时,合并后的单一数据集足以满足快速探索的需求。此时牺牲部分统计精度来换取操作效率是可接受的。非统计建模的下游应用
如果后续操作不属于统计建模范畴(比如制作可视化原型、将数据导入非统计软件做进一步处理,或是作为不需要量化不确定性的机器学习模型输入),单一数据集比多个插补数据集更便于处理。例如要把数据导入可视化工具做交互式图表,多插补数据集会大幅增加操作复杂度,这时合并后的数据集可以作为便捷的替代方案。演示或教学场景
在教学中演示缺失值插补的效果时,用合并后的单一数据集展示插补后的数据形态,比展示多个插补数据集更直观易懂,能帮助初学者快速理解插补对原始数据的改变,无需深入多插补的统计推断细节。插补变异极小的极端情况
若通过插补质量诊断发现,多个插补数据集之间的变异极其微小(比如所有插补变量的插补值标准差接近0),此时合并后的数据集与pool()方法得到的结果差异可以忽略不计——但使用前必须先完成插补质量诊断,确认变异确实可忽略。
内容的提问来源于stack exchange,提问作者Shira

