You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在R中为含退出选项的离散选择实验准备multinomial logit回归数据

离散选择实验:多项Logit回归的数据准备指南

针对你的实验设计(2个备选方案+退出选项、6个双水平属性、869名受访者),数据准备的核心是转换成模型要求的长格式,同时规避共线性问题(这也是你遇到奇异问题的主要原因)。以下是具体步骤和代码:

1. 从宽格式转长格式

离散选择模型(MNL/嵌套Logit)要求每个备选方案对应一行数据,而你手里的原始数据大概率是宽格式(每个受访者一行,包含A、B的所有属性),必须转换。

示例转换代码(用mlogit包,专门处理离散选择数据)

# 先加载依赖包
library(mlogit)
library(tidyverse)

# 假设你的宽格式数据名为d_wide,结构如下:
# resp_id(受访者ID)、A_attr1~A_attr6(方案A的6个属性)、B_attr1~B_attr6(方案B的6个属性)、choice(选择结果:1=A,2=B,3=C)
d_long <- mlogit.data(
  data = d_wide,
  choice = "choice",          # 标记选择结果的列名
  shape = "wide",             # 原始数据是宽格式
  alt = c("A", "B", "C"),     # 列出所有备选方案(包括退出选项C)
  id.var = "resp_id",         # 受访者ID列
  reflevel = "C"              # 指定退出选项C为基准类别
)

转换后的数据每行对应一个受访者的一个备选方案,退出选项C的属性列会自动设为NA(无需手动处理)。

2. 属性编码的避坑点

你用的dummy编码(第一水平1,第二水平0)没问题,但要注意:

  • 退出选项C的属性必须留空(NA),不能填充0,否则模型会误将其识别为属性的第二水平,导致共线性。
  • 检查每个属性在备选方案中的取值是否有变异:比如如果方案A的attr1全是1,这个属性对方案A的效应无法估计,会触发奇异问题。用table(d_long$attr1, d_long$alt)快速排查。

3. 奇异问题的快速排查

你遇到的singularity问题90%是共线性导致的,按以下步骤排查:

  • 检查属性间的相关性:用cor(select(d_long, starts_with("attr"))),如果两个属性相关性为1,删掉其中一个。
  • 检查是否存在"完全预测"的情况:比如某个属性的取值完全对应选择结果(比如选A的受访者attr1全是1),这类变量要移除。
  • 检查受访者选择分布:如果所有受访者都选C,或者某个备选方案没人选,模型无法估计,需要清理这类样本。

4. 基础MNL模型拟合代码

数据准备完成后,拟合多项Logit模型的代码如下:

# 拟合模型,公式中`| 0`表示不加入备选方案的固定效应(由属性系数体现差异)
mnl_model <- mlogit(
  choice ~ attr1 + attr2 + attr3 + attr4 + attr5 + attr6 | 0,
  data = d_long,
  id = "resp_id"
)

# 查看模型结果
summary(mnl_model)

如果需要加入备选方案的固定效应(比如A和B的固有偏好),可以把公式改成choice ~ attr1 + ... + attr6 | 1,但要注意此时可能和属性编码产生共线性,需谨慎。

内容的提问来源于stack exchange,提问作者Nattie

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 22:13:14