如何正确绘制2016年五大热门项目奖牌得主Age特征直方图?
问题分析与修正方案
你的代码存在两个核心问题,导致输出和预期不符:
- 你通过
groupby(['Age','Sport'])['Medal'].count()得到的是各年龄-项目组合的奖牌数量,调用hist()时绘制的是「奖牌数的分布」,而非你需要的「Age特征的分布」。 - 代码未筛选“五大热门项目”,包含了2016年所有项目的奖牌数据,不符合需求范围。
修正后的代码
# 筛选2016年的奖牌得主数据(仅保留有奖牌的记录) df_2016 = df[(df['Year'] == 2016) & (df['Medal'].notna())] # 找出2016年奖牌数量最多的5个热门项目 top5_sports = df_2016['Sport'].value_counts().nlargest(5).index # 筛选五大热门项目的奖牌得主数据 df_top5_medalists = df_2016[df_2016['Sport'].isin(top5_sports)] # 绘制Age特征的直方图(bins可根据需求调整) df_top5_medalists['Age'].hist(bins=15)
代码说明
- 先锁定2016年的奖牌得主数据,排除未获奖的选手,保证数据精准性;
- 通过
value_counts().nlargest(5)快速定位奖牌数最多的5个项目; - 最后直接对筛选后的
Age列调用hist(),绘制的就是五大热门项目所有奖牌得主的年龄分布,与预期输出一致。
内容的提问来源于stack exchange,提问作者the_new_guy
相关产品推荐
相关产品推荐

