如何用Matplotlib或Seaborn绘制教育水平与薪资的计数条形图?
解决方法
你的需求是绘制x轴为教育水平+薪资组合、y轴为对应人数的条形图,原代码的问题在于使用sns.barplot时默认计算的是薪资的均值,而非人数,且未结合教育水平与薪资的组合维度。以下是三种可行的实现方式:
方式一:Seaborn分组条形图(推荐)
这种方式会在每个教育水平下显示两个条形,分别对应薪资0和1的人数,直观对比同一教育水平下的薪资分布:
import pandas as pd import seaborn as sns import matplotlib.pyplot as plt # 读取数据 df = pd.read_csv("ds.csv") # 设置绘图风格 sns.set_style("whitegrid") # 创建画布并绘制分组条形图 plt.figure(figsize=(12, 6)) sns.countplot(data=df, x='Educational level', hue='salary') # 自定义图表标签与样式 plt.title('各教育水平下不同薪资的人数分布') plt.xlabel('教育水平') plt.ylabel('人数') plt.xticks(rotation=45) # 旋转x轴标签避免重叠 plt.legend(title='薪资', labels=['<=50K', '>50K']) # 可根据实际薪资含义调整标签 plt.tight_layout() plt.show()
方式二:合并维度绘制单一组合条形图
如果需要x轴直接显示“教育水平_薪资”的组合(如Bachelors_0、Bachelors_1),可以先创建组合列再绘图:
import pandas as pd import seaborn as sns import matplotlib.pyplot as plt df = pd.read_csv("ds.csv") # 创建教育水平与薪资的组合列 df['edu_salary'] = df['Educational level'] + '_' + df['salary'].astype(str) # 绘制条形图 plt.figure(figsize=(12, 6)) sns.countplot(data=df, x='edu_salary') # 自定义样式 plt.title('教育水平与薪资组合的人数分布') plt.xlabel('教育水平-薪资组合') plt.ylabel('人数') plt.xticks(rotation=45) plt.tight_layout() plt.show()
方式三:Matplotlib原生实现
若偏好使用Matplotlib原生方法,可先分组统计人数再绘图:
import pandas as pd import matplotlib.pyplot as plt df = pd.read_csv("ds.csv") # 按教育水平和薪资分组,统计每组人数 count_df = df.groupby(['Educational level', 'salary']).size().unstack(fill_value=0) # 绘制分组条形图 count_df.plot(kind='bar', figsize=(12, 6)) plt.title('各教育水平下不同薪资的人数分布') plt.xlabel('教育水平') plt.ylabel('人数') plt.xticks(rotation=45) plt.legend(title='薪资', labels=['<=50K', '>50K']) plt.tight_layout() plt.show()
内容的提问来源于stack exchange,提问作者solisbeam
相关产品推荐
相关产品推荐

