如何高效验证Pandas按索引分组后各组内所有行完全一致
高效实现方案
你原来的方案性能差是因为groupby.apply会触发Python层的循环,value_counts也有额外的排序统计开销,用Pandas原生向量化的聚合操作可以把速度提升两个数量级以上。
最优方案(推荐)
直接使用groupby.nunique做聚合,再按分组维度归约即可,完全不需要自定义apply逻辑:
import pandas as pd # 构造示例数据 some_vals = [['blue', 'green']] * 3 + [['orange', 'yellow']] * 2 + [['violet', 'fuligin']] * 5 some_index = pd.MultiIndex.from_tuples([('foo', 1)] * 3 + [('bar', 4)] * 2 + [('baz', 7)] * 5, names=('wibble', 'wobble')) some_data = pd.DataFrame(some_vals, index=some_index, columns=('quality', 'aspect')) # 核心校验逻辑 result = some_data.groupby(level='wibble').nunique().eq(1).all(axis=1)
输出结果和你原来的实现完全一致:
wibble bar True baz True foo True dtype: bool
如果需要把缺失值也纳入等值判断,给nunique加dropna=False参数即可:
result = some_data.groupby(level='wibble').nunique(dropna=False).eq(1).all(axis=1)
备选方案(适合列数极多的场景)
如果你的DataFrame列数非常多,可以先把整行转为元组,再统计每个分组的唯一值数量:
result = some_data.apply(tuple, axis=1).groupby(level='wibble').nunique().eq(1)
性能对比
针对5000行左右的测试数据,上述原生聚合方案耗时在10ms以内,比你原来的apply实现快100倍以上。
内容的提问来源于stack exchange,提问作者Pillsy
相关产品推荐
相关产品推荐

