求助:按10岁区间分组计算平均食品杂货消费并绘制柱状图
年龄分组、计算平均消费及绘制柱状图实现方案
步骤1:导入依赖库
首先导入数据分析和可视化所需工具:
import pandas as pd import matplotlib.pyplot as plt
步骤2:加载数据集
假设数据存储在CSV文件中,用以下代码加载:
df = pd.read_csv("your_dataset.csv") # 替换为你的数据集路径
如果是Excel文件,替换为pd.read_excel("your_dataset.xlsx")即可。
步骤3:按10岁区间划分年龄组
使用pd.cut()函数创建年龄分组,自定义区间标签让结果更直观:
# 定义年龄区间和对应标签,可根据数据中最大年龄调整上限 age_bins = [0, 10, 20, 30, 40, 50, 60, 70, 80, 90, 100] age_labels = ["0-9岁", "10-19岁", "20-29岁", "30-39岁", "40-49岁", "50-59岁", "60-69岁", "70-79岁", "80-89岁", "90-99岁"] # 新增分组列,right=False表示区间左闭右开,符合常规年龄统计逻辑 df["Age Group"] = pd.cut(df["Ages"], bins=age_bins, labels=age_labels, right=False)
步骤4:计算每组平均食品杂货消费
通过groupby()分组后取均值:
grouped_mean = df.groupby("Age Group")["Amount Spent in groceries"].mean().reset_index()
步骤5:绘制柱状图
用matplotlib生成可视化图表:
plt.figure(figsize=(10, 6)) plt.bar(grouped_mean["Age Group"], grouped_mean["Amount Spent in groceries"], color="#4CAF50") # 设置图表细节,避免标签重叠 plt.title("各年龄区间平均食品杂货消费金额", fontsize=14) plt.xlabel("年龄区间", fontsize=12) plt.ylabel("平均消费金额", fontsize=12) plt.xticks(rotation=45) plt.tight_layout() plt.show()
内容的提问来源于stack exchange,提问作者liorse213
相关产品推荐
相关产品推荐

