You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Pandas将柱状图与分布频率密度图合并至同一图表

在同一图表中结合柱状图与密度图的解决方案

首先,我们需要解决两个核心问题:你的数据是分组区间型数据,而密度图需要连续数值输入;同时相对频率和密度的刻度体系不同,得做适配才能在同一图中展示。下面是完整的实现步骤和代码:

步骤1:修正并预处理数据

先修正你代码里的小错误(df3是笔误,应该用df),然后提取每个区间的中点——这是生成密度图的关键前提:

import pandas as pd
import numpy as np
import matplotlib.pyplot as plt
from scipy.stats import gaussian_kde

# 原始数据
data = [['1-8 miles',14,0.23],['9-16 miles',21,0.35],['17-24 miles',11,0.16], 
        ['33-40 miles',4,0.07],['41-46 miles',4,0.07],['Total',60,1.00]]
cols = ['Class Limits','Frequency','Relative Frequency']
df = pd.DataFrame(data,columns = cols)

# 移除最后一行的Total汇总
last_row = len(df)-1
df2 = df[['Class Limits','Frequency','Relative Frequency']].drop(df.index[last_row])

# 定义函数提取区间中点
def get_midpoint(interval_str):
    # 拆分区间字符串,提取上下限数字
    num_part = interval_str.split(' miles')[0]
    low, high = map(int, num_part.split('-'))
    return (low + high)/2

# 给数据添加中点列
df2['Midpoint'] = df2['Class Limits'].apply(get_midpoint)

步骤2:生成密度估计所需的样本数据

我们可以根据每个区间的频率,生成对应数量的中点值,这样就能用核密度估计(KDE)拟合出平滑的分布曲线:

# 生成模拟样本:每个区间中点重复对应频率次
sample_data = []
for _, row in df2.iterrows():
    sample_data.extend([row['Midpoint']] * row['Frequency'])
sample_data = np.array(sample_data)

# 计算核密度估计
kde = gaussian_kde(sample_data)
# 生成连续的x值用于绘制密度曲线
x_vals = np.linspace(df2['Midpoint'].min()-5, df2['Midpoint'].max()+5, 1000)
density_vals = kde(x_vals)

步骤3:绘制组合图表(双y轴推荐版)

因为相对频率和密度的刻度逻辑不同,用双y轴能更清晰地展示两者,避免数值混淆:

fig, ax1 = plt.subplots(figsize=(10,6))

# 绘制相对频率柱状图
bars = ax1.bar(df2['Class Limits'], df2['Relative Frequency'], color='skyblue', alpha=0.7, label='Relative Frequency')
ax1.set_xlabel('Distance Intervals')
ax1.set_ylabel('Relative Frequency', color='tab:blue')
ax1.tick_params(axis='y', labelcolor='tab:blue')
ax1.set_title('Relative Frequency Bar Chart with Density Curve')

# 添加第二坐标轴绘制密度图
ax2 = ax1.twinx()
ax2.plot(x_vals, density_vals, color='tab:red', linewidth=2, label='Density')
ax2.set_ylabel('Density', color='tab:red')
ax2.tick_params(axis='y', labelcolor='tab:red')

# 合并图例
lines1, labels1 = ax1.get_legend_handles_labels()
lines2, labels2 = ax2.get_legend_handles_labels()
ax1.legend(lines1 + lines2, labels1 + labels2, loc='upper right')

plt.tight_layout()
plt.show()

可选:单y轴版本(缩放密度值)

如果你希望用同一个y轴展示,可以将密度值乘以组距(因为相对频率 = 密度 × 组距)。考虑到你的区间宽度不完全统一,这里用平均组距做缩放:

# 计算每个区间的宽度
df2['Class Width'] = df2['Class Limits'].apply(lambda x: int(x.split(' miles')[0].split('-')[1]) - int(x.split(' miles')[0].split('-')[0]))
avg_width = df2['Class Width'].mean()

# 缩放密度值以匹配相对频率的刻度
scaled_density = density_vals * avg_width

fig, ax = plt.subplots(figsize=(10,6))
# 绘制柱状图
ax.bar(df2['Class Limits'], df2['Relative Frequency'], color='skyblue', alpha=0.7, label='Relative Frequency')
# 绘制缩放后的密度曲线
ax.plot(x_vals, scaled_density, color='tab:red', linewidth=2, label='Scaled Density')

ax.set_xlabel('Distance Intervals')
ax.set_ylabel('Relative Frequency / Scaled Density')
ax.legend()
ax.set_title('Relative Frequency Bar Chart with Scaled Density Curve')
plt.tight_layout()
plt.show()

关键说明

  • 分组数据转连续值:必须提取区间中点,因为密度图只能基于连续数值生成
  • 双y轴vs单y轴:双y轴更严谨,能保留两种统计量的原始刻度;单y轴适合快速对比分布形态,需要对密度值做缩放适配
  • KDE的作用:核密度估计可以从分组样本中拟合出平滑的分布曲线,直观展示数据的频率集中模式

内容的提问来源于stack exchange,提问作者redmage123

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.07 12:07:35