如何使用Pandas将柱状图与分布频率密度图合并至同一图表
在同一图表中结合柱状图与密度图的解决方案
首先,我们需要解决两个核心问题:你的数据是分组区间型数据,而密度图需要连续数值输入;同时相对频率和密度的刻度体系不同,得做适配才能在同一图中展示。下面是完整的实现步骤和代码:
步骤1:修正并预处理数据
先修正你代码里的小错误(df3是笔误,应该用df),然后提取每个区间的中点——这是生成密度图的关键前提:
import pandas as pd import numpy as np import matplotlib.pyplot as plt from scipy.stats import gaussian_kde # 原始数据 data = [['1-8 miles',14,0.23],['9-16 miles',21,0.35],['17-24 miles',11,0.16], ['33-40 miles',4,0.07],['41-46 miles',4,0.07],['Total',60,1.00]] cols = ['Class Limits','Frequency','Relative Frequency'] df = pd.DataFrame(data,columns = cols) # 移除最后一行的Total汇总 last_row = len(df)-1 df2 = df[['Class Limits','Frequency','Relative Frequency']].drop(df.index[last_row]) # 定义函数提取区间中点 def get_midpoint(interval_str): # 拆分区间字符串,提取上下限数字 num_part = interval_str.split(' miles')[0] low, high = map(int, num_part.split('-')) return (low + high)/2 # 给数据添加中点列 df2['Midpoint'] = df2['Class Limits'].apply(get_midpoint)
步骤2:生成密度估计所需的样本数据
我们可以根据每个区间的频率,生成对应数量的中点值,这样就能用核密度估计(KDE)拟合出平滑的分布曲线:
# 生成模拟样本:每个区间中点重复对应频率次 sample_data = [] for _, row in df2.iterrows(): sample_data.extend([row['Midpoint']] * row['Frequency']) sample_data = np.array(sample_data) # 计算核密度估计 kde = gaussian_kde(sample_data) # 生成连续的x值用于绘制密度曲线 x_vals = np.linspace(df2['Midpoint'].min()-5, df2['Midpoint'].max()+5, 1000) density_vals = kde(x_vals)
步骤3:绘制组合图表(双y轴推荐版)
因为相对频率和密度的刻度逻辑不同,用双y轴能更清晰地展示两者,避免数值混淆:
fig, ax1 = plt.subplots(figsize=(10,6)) # 绘制相对频率柱状图 bars = ax1.bar(df2['Class Limits'], df2['Relative Frequency'], color='skyblue', alpha=0.7, label='Relative Frequency') ax1.set_xlabel('Distance Intervals') ax1.set_ylabel('Relative Frequency', color='tab:blue') ax1.tick_params(axis='y', labelcolor='tab:blue') ax1.set_title('Relative Frequency Bar Chart with Density Curve') # 添加第二坐标轴绘制密度图 ax2 = ax1.twinx() ax2.plot(x_vals, density_vals, color='tab:red', linewidth=2, label='Density') ax2.set_ylabel('Density', color='tab:red') ax2.tick_params(axis='y', labelcolor='tab:red') # 合并图例 lines1, labels1 = ax1.get_legend_handles_labels() lines2, labels2 = ax2.get_legend_handles_labels() ax1.legend(lines1 + lines2, labels1 + labels2, loc='upper right') plt.tight_layout() plt.show()
可选:单y轴版本(缩放密度值)
如果你希望用同一个y轴展示,可以将密度值乘以组距(因为相对频率 = 密度 × 组距)。考虑到你的区间宽度不完全统一,这里用平均组距做缩放:
# 计算每个区间的宽度 df2['Class Width'] = df2['Class Limits'].apply(lambda x: int(x.split(' miles')[0].split('-')[1]) - int(x.split(' miles')[0].split('-')[0])) avg_width = df2['Class Width'].mean() # 缩放密度值以匹配相对频率的刻度 scaled_density = density_vals * avg_width fig, ax = plt.subplots(figsize=(10,6)) # 绘制柱状图 ax.bar(df2['Class Limits'], df2['Relative Frequency'], color='skyblue', alpha=0.7, label='Relative Frequency') # 绘制缩放后的密度曲线 ax.plot(x_vals, scaled_density, color='tab:red', linewidth=2, label='Scaled Density') ax.set_xlabel('Distance Intervals') ax.set_ylabel('Relative Frequency / Scaled Density') ax.legend() ax.set_title('Relative Frequency Bar Chart with Scaled Density Curve') plt.tight_layout() plt.show()
关键说明
- 分组数据转连续值:必须提取区间中点,因为密度图只能基于连续数值生成
- 双y轴vs单y轴:双y轴更严谨,能保留两种统计量的原始刻度;单y轴适合快速对比分布形态,需要对密度值做缩放适配
- KDE的作用:核密度估计可以从分组样本中拟合出平滑的分布曲线,直观展示数据的频率集中模式
内容的提问来源于stack exchange,提问作者redmage123
相关产品推荐
相关产品推荐

