Pandas如何按id分组根据日期变更生成周期period字段
Pandas 实现方案
步骤1:构造测试数据与预处理
首先将日期列转换为datetime格式,避免字符串对比出现异常,示例代码如下:
import pandas as pd # 构造测试数据集 data = { "id": [111, 111, 111, 222, 111, 111, 222, 222, 222], "date": ["2021-08-10", "2021-08-11", "2021-08-11", "2021-08-11", "2021-08-12", "2021-08-13", "2021-08-13", "2021-08-13", "2021-08-14"] } df = pd.DataFrame(data) # 转换日期列为datetime格式 df["date"] = pd.to_datetime(df["date"])
步骤2:生成period列
方法1:基于日期排序编码(通用方案,无需提前排序)
通过factorize的sort参数对分组内的日期按时间顺序编码,自动匹配同一日期的编号,代码如下:
df["period"] = df.groupby("id")["date"].transform( lambda x: pd.factorize(x, sort=True)[0] + 1 )
该方案无需提前对数据集排序,会自动按日期的时间先后分配递增编号,适配任意行顺序的原始数据。
方法2:基于日期差判断(大数据量下效率更高)
如果原始数据可按id和日期排序,可通过判断相邻行日期差的方式生成编号,计算效率更高:
# 先按id、日期升序排序,保证日期顺序正确 df = df.sort_values(["id", "date"]).reset_index(drop=True) # 分组判断日期是否变化,累加得到递增编号 df["period"] = df.groupby("id")["date"].diff().dt.days.ne(0).groupby(df["id"]).cumsum()
两种方法输出的结果均符合要求,直接打印print(df)即可看到预期输出。
内容的提问来源于stack exchange,提问作者NineWasps
相关产品推荐
相关产品推荐

