关于含有序/无序因子的二项式GLM的三类技术疑问
二项式GLM与esoph数据集的常见问题解答
1. 为何binomial族GLM可接受cbind(ncases,ncontrols)形式的响应变量?模型预测目标是什么?
- 这种输入格式对应分组二项式数据:
ncases是每组中“事件发生”(这里指食道癌病例数)的样本量,ncontrols是每组中“事件未发生”(对照人数)的样本量。 - binomial族GLM的核心是建模事件发生的概率,这里的预测目标是:给定分组的年龄、饮酒量、吸烟量等变量,该组人群患食道癌的概率。R会自动将这两列转换为二项分布要求的
(成功数, 总试验数)结构,总试验数即ncases + ncontrols。
2. summary(mod1)输出中,agegp.L、agegp.Q等变量后缀L、Q、C、^4、^5代表什么?
这些后缀是正交多项式对比的标识,当你将因子设为有序因子(ordered = TRUE)时,R默认会对因子水平做正交多项式分解:
L:Linear(线性趋势),用于检验因子水平随顺序变化时,与响应变量的线性关联强度Q:Quadratic(二次趋势),检验是否存在曲线型的二次关联C:Cubic(三次趋势),检验三次曲线关联^4、^5:对应四次、五次多项式趋势
这种分解的目的是分析因子水平的顺序和响应变量之间的趋势关系,而非单纯的组间差异。
3. 为何agegp、alcgp、tobgp作为有序/无序因子时,模型系数存在差异?
核心原因是两种因子类型使用的对比策略完全不同:
- 无序因子(默认
contr.treatment对比):以因子的第一个水平为参照组,其余每个水平的系数代表该水平与参照组的对数优势比差值,聚焦于组间的直接差异。 - 有序因子(默认
contr.poly对比):采用正交多项式对比,系数对应的是线性、二次等趋势项的效应,描述的是因子水平随顺序变化时,与响应变量的整体趋势强度,而非组间差值。
由于建模的目标和对比逻辑不同,两种情况下的系数含义、数值自然存在差异。
内容的提问来源于stack exchange,提问作者Nemo
相关产品推荐
相关产品推荐

