如何按用户分组统计Signed_up后创建的计划数量?
问题描述
现有如下DataFrame,每行代表用户生成的一个计划:
df1 = [['aa', '21/01/2022', ''], ['aa', '22/01/2022', '22/01/2022'], ['aa', '22/01/2022', ''], ['aa', '22/01/2022', ''], ['bb', '25/01/2022', '25/01/2022'],['bb', '26/01/2022', ''], ['bb', '26/01/2022', ''],['cc', '21/01/2022', ''], ['cc', '21/01/2022', '22/01/2022'], ['cc', '21/01/2022', '']] import pandas as pd df = pd.DataFrame(df1, columns=['userid', 'Created', 'Signed_up'])
需求:统计每个用户在完成Signed_up(即Signed_up列非空)之后生成的计划数量,已知每个用户仅有一次Signed_up记录。
曾尝试使用groupby()结合cumsum()或cumcount()实现,但无法正确加入“此前存在非空Signed_up”的条件,期望得到如下格式的输出:
df2 = [['aa', '21/01/2022', '', ''], ['aa', '22/01/2022', '22/01/2022', ''], ['aa', '22/01/2022', '', '1'], ['aa', '22/01/2022', '', '2'], ['bb', '25/01/2022', '25/01/2022', ''],['bb', '26/01/2022', '', '1'], ['bb', '26/01/2022', '', '2'],['cc', '21/01/2022', '', ''], ['cc', '21/01/2022', '22/01/2022', ''], ['cc', '21/01/2022', '', '1']] df_3 = pd.DataFrame(df2, columns=['userid', 'Created', 'Signed_up', 'count'])
解决方法
可以通过以下步骤实现需求:
- 标记Signed_up完成的位置:为每个用户生成标记列,标识当前行是否在Signed_up记录之后。
- 计算后续计划的累计计数:基于标记列,对每个用户在Signed_up之后的行进行累计计数,非后续行设为空字符串。
具体代码如下:
import pandas as pd # 构建原始DataFrame df1 = [['aa', '21/01/2022', ''], ['aa', '22/01/2022', '22/01/2022'], ['aa', '22/01/2022', ''], ['aa', '22/01/2022', ''], ['bb', '25/01/2022', '25/01/2022'],['bb', '26/01/2022', ''], ['bb', '26/01/2022', ''],['cc', '21/01/2022', ''], ['cc', '21/01/2022', '22/01/2022'], ['cc', '21/01/2022', '']] df = pd.DataFrame(df1, columns=['userid', 'Created', 'Signed_up']) # 生成标记列:标识是否已完成Signed_up df['has_signed'] = df.groupby('userid')['Signed_up'].transform( lambda x: x.ne('').cumsum().ge(1) ) # 计算累计计数:仅统计Signed_up之后的非Signed_up行 df['count'] = df.groupby('userid').apply( lambda g: g['has_signed'].cumsum().where( (g['has_signed'] == 1) & (g['Signed_up'] == ''), '' ).astype(str) ).reset_index(drop=True) # 移除中间列,得到最终结果 df_final = df.drop('has_signed', axis=1) print(df_final)
代码解释:
has_signed列:按用户分组后,x.ne('').cumsum()将Signed_up非空行标记为1,后续行累加为1或更高;.ge(1)将所有在Signed_up之后的行转为True,之前的为False。count列:再次按用户分组,对has_signed累计求和,通过where筛选出已完成Signed_up且当前行不是Signed_up记录的行,其他行设为空字符串,最后转为字符串类型匹配期望输出。
运行后得到的df_final与需求中的df_3完全一致。
内容的提问来源于stack exchange,提问作者user20301979
相关产品推荐
相关产品推荐

