Seaborn绘制Titanic数据集亲属-存活条形图的生成逻辑与含义
Seaborn barplot对二值Y轴的统计逻辑说明
问题背景
针对Kaggle泰坦尼克数据集做EDA时,通过合并Parch与SibSp字段生成统计乘客随行亲属总人数的特征relative,构造代码如下:
data['relative'] = data['Parch'] + data['SibSp']
调用Seaborn的barplot绘制relative与Survived的关系图时,得到如下输出:
现有疑问:Survived是仅取0、1的二分类字段,relative是取值1-6的离散字段,无法理解该条形图的生成规则和展示的统计信息。
具体逻辑解释
Seaborn的barplot不是逐样本绘制原始值,而是默认做分组聚合计算,各元素含义如下:
- x轴:按
relative的不同取值拆分乘客分组,每个独立柱子对应一个固定亲属数量的乘客群体 - y轴:默认计算每个分组下Y字段(即
Survived)的平均值。由于Survived用1代表存活、0代表未存活,这个平均值就是对应分组的乘客存活率 - 柱子顶部的黑色短竖线:95%置信区间误差棒,用来衡量该分组存活率估计的不确定性,分组内样本量越少,误差棒通常越长
举个简单算例:如果亲属人数为1的分组共有200名乘客,其中70人存活,那这个分组的柱子高度就是70/200=0.35,代表该组35%的存活率。
内容的提问来源于stack exchange,提问作者Amish
相关产品推荐
相关产品推荐

