You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Seaborn绘制Titanic数据集亲属-存活条形图的生成逻辑与含义

Seaborn barplot对二值Y轴的统计逻辑说明

问题背景

针对Kaggle泰坦尼克数据集做EDA时,通过合并Parch与SibSp字段生成统计乘客随行亲属总人数的特征relative,构造代码如下:

data['relative'] = data['Parch'] + data['SibSp']

调用Seaborn的barplot绘制relative与Survived的关系图时,得到如下输出:
亲属人数-存活率条形图
现有疑问:Survived是仅取0、1的二分类字段,relative是取值1-6的离散字段,无法理解该条形图的生成规则和展示的统计信息。

具体逻辑解释

Seaborn的barplot不是逐样本绘制原始值,而是默认做分组聚合计算,各元素含义如下:

  • x轴:按relative的不同取值拆分乘客分组,每个独立柱子对应一个固定亲属数量的乘客群体
  • y轴:默认计算每个分组下Y字段(即Survived)的平均值。由于Survived用1代表存活、0代表未存活,这个平均值就是对应分组的乘客存活率
  • 柱子顶部的黑色短竖线:95%置信区间误差棒,用来衡量该分组存活率估计的不确定性,分组内样本量越少,误差棒通常越长

举个简单算例:如果亲属人数为1的分组共有200名乘客,其中70人存活,那这个分组的柱子高度就是70/200=0.35,代表该组35%的存活率。


内容的提问来源于stack exchange,提问作者Amish

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 05:45:40