如何在Pandas MultiIndex中计算两子列间的占比?
解决Pandas MultiIndex DataFrame的yes列占比计算问题
嘿,我来帮你搞定这个MultiIndex结构下的占比计算需求!首先咱们先把你的示例DataFrame构造出来,方便后续操作:
import pandas as pd # 构造你提供的MultiIndex DataFrame data = { ('col1', 'no'): [2, 0], ('col1', 'yes'): [8, 2], ('col2', 'no'): [2, 1], ('col2', 'yes'): [6, 1] } df = pd.DataFrame(data, index=['A', 'B'])
接下来有两种简洁的方法可以实现你要的**每个主列下yes/(no+yes)**的占比计算:
方法一:按主列分组计算
利用groupby按列的第一层(主列)分组,然后对每个组单独计算yes的占比:
# 按第一层列索引(col1、col2)分组,应用占比计算逻辑 result = df.groupby(level=0, axis=1).apply(lambda x: x['yes'] / (x['no'] + x['yes'])) # 给结果重新设置MultiIndex列结构,和预期格式匹配 result.columns = pd.MultiIndex.from_product([result.columns, ['yes']])
这个方法的好处是就算后续主列增加,代码也不需要修改,扩展性很强。
方法二:直接选取子列计算
如果你确定每个主列下都固定有no和yes子列,也可以直接通过xs(cross-section)选取对应的子列,再做除法:
# 分别提取所有yes和no子列 yes_cols = df.xs('yes', level=1, axis=1) no_cols = df.xs('no', level=1, axis=1) # 计算占比:yes/(yes+no) result = yes_cols.div(yes_cols + no_cols) # 重新构造MultiIndex列,和预期格式一致 result.columns = pd.MultiIndex.from_tuples([(col, 'yes') for col in result.columns])
这个方法更直观,执行效率也更高,适合结构固定的DataFrame。
运行任意一种方法后,你都会得到和预期完全一致的结果:
col1 col2 yes yes A 0.8 0.75 B 1.0 0.5
内容的提问来源于stack exchange,提问作者ambigus9
相关产品推荐
相关产品推荐

