寻求含分类与数值预测变量的多重共线性分析专用数据集
适合共线性测试与特征重要性分析的数据集推荐
嘿,我给你找了几个完全符合你需求的数据集,专门用于共线性测试和多重共线性场景下的特征重要性分析。下面是我的首选推荐:
一、泰坦尼克号生存数据集(Titanic Dataset)
这个经典数据集绝对能满足你的所有要求:
- 二元响应变量:
Survived(1表示存活,0表示未存活) - 混合类型预测变量:
- 数值变量:
Age(乘客年龄)、Fare(船票价格)、SibSp(同乘的兄弟姐妹/配偶数量)、Parch(同乘的父母/子女数量) - 分类变量:
Pclass(船舱等级:1/2/3等)、Sex(性别)、Embarked(登船港口:C/Q/S)、Ticket(船票编号,可作为分类特征处理)
- 数值变量:
- 变量说明:所有字段的定义都非常清晰,不管是官方文档还是各类数据分析教程里,都能轻松找到详细的变量解释。
适配场景的优势:
- 你可以轻松构造共线性测试场景:比如利用
Fare和Pclass的天然关联(船舱等级越高,票价通常越高),或者手动生成一个和Age高度相关的特征(比如Age*1.2 + 小幅度随机噪声)来模拟强共线性。 - 不管是用方差膨胀因子(VIF)做共线性检测,还是对比*树模型(如随机森林,对共线性鲁棒)和线性模型(如逻辑回归,受共线性影响较大)*的特征重要性差异,这个数据集都能完美支撑你的分析。
二、德国信用数据集(German Credit Dataset)
这是另一个非常适合金融领域相关分析的经典数据集:
- 二元响应变量:
CreditRisk(1表示信用良好,0表示信用不良) - 混合类型预测变量:
- 数值变量:
Duration(贷款期限,单位:月)、CreditAmount(贷款金额)、Age(申请人年龄) - 分类变量:
CheckingAccountStatus(支票账户状态)、CreditHistory(信用历史)、Purpose(贷款用途)、SavingsAccount(储蓄账户情况)等(共19个分类特征)
- 数值变量:
- 变量说明:每个分类特征的不同类别都有明确定义,比如
CheckingAccountStatus包含"无账户"、"余额<0"、"余额0-200"、"余额>200"四类,数值特征的含义也一目了然。
适配场景的优势:
- 数据本身就存在天然的共线性关系,比如
CreditAmount和Duration(贷款金额越高,期限通常越长),不需要手动构造就能直接测试共线性的影响。 - 分类特征丰富,你可以测试不同编码方式(如独热编码、目标编码)对共线性的影响,再结合特征重要性分析,能得到更全面的结论。
三、威斯康星乳腺癌诊断数据集(Wisconsin Breast Cancer Dataset)
虽然这个数据集原生以数值特征为主,但你可以轻松扩展出分类特征来满足混合类型的要求:
- 二元响应变量:
Diagnosis(M表示恶性,B表示良性) - 原有数值变量:包含30个细胞特征的数值指标(如半径、纹理、周长等,很多指标间天然存在强共线性,比如半径和周长高度相关)
- 可手动添加的分类特征:比如将现有数值特征分组(如把"半径"分成"小/中/大"三类作为分类变量),或者模拟患者性别、就诊医院等分类字段。
- 变量说明:每个数值特征的医学定义都有详细说明,方便你理解特征间的内在关联。
适配场景的优势:
- 数据集的天然共线性极强,非常适合测试各类共线性检测方法(如VIF、相关系数矩阵),以及分析共线性对线性模型特征系数和树模型特征重要性的影响。
内容的提问来源于stack exchange,提问作者atomaty
相关产品推荐
相关产品推荐

