You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python Pandas按列值频率排序DataFrame排查层级父子关系错误

实现方法

核心思路是给去重后的每条关系链追加对应E值的重复次数,再按次数倒排、E值正排,就能把问题最严重的记录优先展示,相同E的所有关系链也会聚合在一起方便比对。
你可以直接用下面的代码实现:

# 方法1:如果你已经生成了dfgroups统计结果,直接映射计数
# 给去重后的关系链追加对应E的出现次数
dfdrop['count'] = dfdrop['E'].map(dfgroups.set_index('E')['count'])
# 按count降序、E值升序排序,问题最多的E排在最前,相同E的记录聚合在一起
sorted_df = dfdrop.sort_values(by=['count', 'E'], ascending=[False, True])
# 不需要保留count列可以直接删除
sorted_df = sorted_df.drop(columns=['count'])
# 输出结果
print(sorted_df)

如果不想提前生成dfgroups,也可以一步完成所有操作,不会修改原始的dfdrop:

# 方法2:一步完成计数、排序,不修改原始去重表
sorted_df = (
    dfdrop
    .assign(count=lambda x: x.groupby('E')['E'].transform('count'))
    .sort_values(by=['count', 'E'], ascending=[False, True])
    .drop(columns=['count'])
)
print(sorted_df)

执行后输出的结果就符合你的预期:count为4的E值对应的所有关系链排在最前面,接下来是count为3、count为2的错误记录,最后是无问题的count为1的记录,相同E的所有关系链会连续展示,你可以直接对比同一E对应的A/B/C/D列的差异,快速定位录入错误。

内容的提问来源于stack exchange,提问作者TheLastWhiteKid

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 10:15:10