You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何按用户分组统计Signed_up后创建的计划数量?

问题描述

现有如下DataFrame,每行代表用户生成的一个计划:

df1 = [['aa', '21/01/2022', ''], ['aa', '22/01/2022', '22/01/2022'],
       ['aa', '22/01/2022', ''], ['aa', '22/01/2022', ''],
       ['bb', '25/01/2022', '25/01/2022'],['bb', '26/01/2022', ''], 
       ['bb', '26/01/2022', ''],['cc', '21/01/2022', ''], 
       ['cc', '21/01/2022', '22/01/2022'], ['cc', '21/01/2022', '']]

import pandas as pd
df = pd.DataFrame(df1, columns=['userid', 'Created', 'Signed_up'])

需求:统计每个用户在完成Signed_up(即Signed_up列非空)之后生成的计划数量,已知每个用户仅有一次Signed_up记录。

曾尝试使用groupby()结合cumsum()或cumcount()实现,但无法正确加入“此前存在非空Signed_up”的条件,期望得到如下格式的输出:

df2 = [['aa', '21/01/2022', '', ''], ['aa', '22/01/2022', '22/01/2022', ''],
       ['aa', '22/01/2022', '', '1'], ['aa', '22/01/2022', '', '2'],
       ['bb', '25/01/2022', '25/01/2022', ''],['bb', '26/01/2022', '', '1'], 
       ['bb', '26/01/2022', '', '2'],['cc', '21/01/2022', '', ''], 
       ['cc', '21/01/2022', '22/01/2022', ''], ['cc', '21/01/2022', '', '1']]
    
df_3 = pd.DataFrame(df2, columns=['userid', 'Created', 'Signed_up', 'count'])
解决方法

可以通过以下步骤实现需求:

  1. 标记Signed_up完成的位置:为每个用户生成标记列,标识当前行是否在Signed_up记录之后。
  2. 计算后续计划的累计计数:基于标记列,对每个用户在Signed_up之后的行进行累计计数,非后续行设为空字符串。

具体代码如下:

import pandas as pd

# 构建原始DataFrame
df1 = [['aa', '21/01/2022', ''], ['aa', '22/01/2022', '22/01/2022'],
       ['aa', '22/01/2022', ''], ['aa', '22/01/2022', ''],
       ['bb', '25/01/2022', '25/01/2022'],['bb', '26/01/2022', ''], 
       ['bb', '26/01/2022', ''],['cc', '21/01/2022', ''], 
       ['cc', '21/01/2022', '22/01/2022'], ['cc', '21/01/2022', '']]
df = pd.DataFrame(df1, columns=['userid', 'Created', 'Signed_up'])

# 生成标记列:标识是否已完成Signed_up
df['has_signed'] = df.groupby('userid')['Signed_up'].transform(
    lambda x: x.ne('').cumsum().ge(1)
)

# 计算累计计数:仅统计Signed_up之后的非Signed_up行
df['count'] = df.groupby('userid').apply(
    lambda g: g['has_signed'].cumsum().where(
        (g['has_signed'] == 1) & (g['Signed_up'] == ''), ''
    ).astype(str)
).reset_index(drop=True)

# 移除中间列,得到最终结果
df_final = df.drop('has_signed', axis=1)
print(df_final)

代码解释:

  • has_signed列:按用户分组后,x.ne('').cumsum()将Signed_up非空行标记为1,后续行累加为1或更高;.ge(1)将所有在Signed_up之后的行转为True,之前的为False。
  • count列:再次按用户分组,对has_signed累计求和,通过where筛选出已完成Signed_up且当前行不是Signed_up记录的行,其他行设为空字符串,最后转为字符串类型匹配期望输出。

运行后得到的df_final与需求中的df_3完全一致。

内容的提问来源于stack exchange,提问作者user20301979

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 21:55:22