You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

咨询含cluster参数的时依Cox回归代码正确性及样本量异常问题

时依Cox生存分析代码正确性解答

代码有效性判断

你贴的这段代码是正确的,具体原因如下:

  • 时依Cox模型采用的计数过程格式数据集,每个ID对应多行风险区间记录(每行对应tStart到tStop的时间段),coxph默认会把每行当成一个风险区间条目,所以输出里的“样本量”其实是风险区间的总数,不是实际个体数,你看到的“样本量翻倍”是正常现象,并非代码错误。
  • 加上cluster = ID参数非常必要:它会在计算标准误时考虑同一个体不同风险区间的相关性,避免因为同一ID的多条记录导致标准误被低估,能得到更稳健的HR和置信区间结果。

补充提示

  • 要查看真实的个体样本量,可以运行nrow(unique(df_timedep[, "ID"])),得到的就是数据集中的独立ID数量。
  • 如果score是随时间变化的变量(不同区间取值不同),这种计数过程格式的分析完全适配;就算score是固定变量,用这种格式分析的结果和单条记录格式一致,但cluster参数依然能帮你修正标准误。

内容的提问来源于stack exchange,提问作者mumber1

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.01 02:01:57