You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Pandas对两个排序表做窗口聚合,获取每个B的Top2热门A

解决方案

假设你使用的是Python Pandas(从groupby/aggregate的描述来看大概率是),以下是直接可行的实现方式:

场景1:表A已按A的计数排序(符合你的描述)

因为表A已经按A的计数排序,同一个Column B分组下,靠前的Column A就是热度更高的。我们只需按Column B分组后取每组前2条数据:

  • 如果只需要保留表B中存在的B值,先过滤表A:
import pandas as pd

# 过滤表A,仅保留表B中包含的B值
filtered_a = df_A[df_A['Column B'].isin(df_B['Column B'])]
  • 分组取前2个热门A:
# 按Column B分组,每组取前2行
result = filtered_a.groupby('Column B').head(2)

场景2:表A未预先排序(额外补充)

如果表A没按A的计数排序,需要先对每组内的A计数并排序,再取前2:

# 按B分组,每组内统计A的出现次数并降序排序,取前2
result = df_A.groupby('Column B').apply(
    lambda group: group['Column A'].value_counts().head(2).reset_index(name='热度计数')
).reset_index(drop=True)

说明

  • 第一种场景直接复用了表A已排序的特性,效率更高;
  • 第二种场景会自动统计每个A的热度并排序,适合未预先处理的原始数据。

内容的提问来源于stack exchange,提问作者hurricane133

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.10 16:35:21