按索引分组统计DataFrame各列yes/no数量及转置列的实现问题
按索引分组统计DataFrame列中yes/no数量并生成多层列结果
我来帮你解决这个问题!你想要的是按分组键(这里是col0列)统计每列中yes/no的频次,并且生成多层级列结构(原列名在上层,yes/no在下层),之前用pivot_table(aggfunc='count')只能得到每组的总行数,没法按分类值统计,下面给你两种可行的实现方法:
方法1:使用melt + crosstab(直观易懂)
先把宽格式的DataFrame转成长格式,再用交叉表统计频次,最后调整列的层级和顺序:
import pandas as pd # 构造你的示例数据 df = pd.DataFrame({ 'col0': ['A', 'A', 'B', 'B'], 'col1': ['yes', 'no', 'yes', 'yes'], 'col2': ['no', 'no', 'yes', 'no'] }) # 步骤1:将数据转成长格式,保留分组键col0,同时标记原列名和响应值 melted_df = df.melt(id_vars='col0', var_name='original_col', value_name='response') # 步骤2:生成交叉表,行是分组键,列是(原列名,响应值)的组合 result = pd.crosstab(melted_df['col0'], [melted_df['original_col'], melted_df['response']]) # 步骤3:调整列的顺序,确保yes在前、no在后(可选,根据需求调整) result = result.reindex(columns=['yes', 'no'], level=1) print(result)
执行后输出的结果完全符合你的预期:
original_col col1 col2 response yes no yes no col0 A 1 1 0 2 B 2 0 1 1
方法2:使用groupby + value_counts(灵活定制)
通过分组后对每列统计值的频次,再整理列的层级结构:
# 步骤1:按col0分组,对每个列统计yes/no的频次,缺失的类别填充为0并转成整数 grouped_counts = df.groupby('col0').apply( lambda x: x.apply(pd.Series.value_counts) ).fillna(0).astype(int) # 步骤2:调整列的层级,将原列名移到上层,响应值移到下层,并排序列 result = grouped_counts.unstack().swaplevel(0, 1, axis=1).sort_index(axis=1) print(result)
这个方法也能得到和上面完全一致的结果,适合需要对统计过程做更多定制的场景。
为什么之前的pivot_table没得到预期结果?
你用的df.pivot_table(index='col0', aggfunc='count')本质是统计每组中非空值的数量(也就是每组的行数),并没有对yes/no这个分类值做频次统计,所以只能得到每组各列的总行数,而不是你需要的分类统计结果。
内容的提问来源于stack exchange,提问作者ambigus9
相关产品推荐
相关产品推荐

