咨询含cluster参数的时依Cox回归代码正确性及样本量异常问题
时依Cox生存分析代码正确性解答
代码有效性判断
你贴的这段代码是正确的,具体原因如下:
- 时依Cox模型采用的计数过程格式数据集,每个ID对应多行风险区间记录(每行对应
tStart到tStop的时间段),coxph默认会把每行当成一个风险区间条目,所以输出里的“样本量”其实是风险区间的总数,不是实际个体数,你看到的“样本量翻倍”是正常现象,并非代码错误。 - 加上
cluster = ID参数非常必要:它会在计算标准误时考虑同一个体不同风险区间的相关性,避免因为同一ID的多条记录导致标准误被低估,能得到更稳健的HR和置信区间结果。
补充提示
- 要查看真实的个体样本量,可以运行
nrow(unique(df_timedep[, "ID"])),得到的就是数据集中的独立ID数量。 - 如果
score是随时间变化的变量(不同区间取值不同),这种计数过程格式的分析完全适配;就算score是固定变量,用这种格式分析的结果和单条记录格式一致,但cluster参数依然能帮你修正标准误。
内容的提问来源于stack exchange,提问作者mumber1
相关产品推荐
相关产品推荐

