You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中基于接听条件分组,获取已接听通话的最大日期

解决方案

你遇到的问题核心是需要仅针对已接听(answered=1)的通话记录计算最大日期,没有接听记录的手机号返回空值。下面提供两种可行的实现方式:

方法一:过滤后分组 + 左连接补全

这种方法先筛选出有效记录,再结合所有手机号的集合来补全空值,逻辑清晰且效率较高:

import pandas as pd

# 假设你的原始DataFrame是df
# 第一步:筛选已接听的通话,分组计算每个手机号的最大通话日期
answered_dates = df[df['answered'] == 1].groupby('phone_number')['call_date'].max().reset_index(name='max_call_date')

# 第二步:获取所有唯一的手机号,与上述结果左连接,自动填充空值为NaN
result = df[['phone_number']].drop_duplicates().merge(answered_dates, on='phone_number', how='left')

逻辑说明:

  1. 先通过df[df['answered'] == 1]过滤出所有已接听的通话记录,只对这些记录计算最大日期。
  2. 用df[['phone_number']].drop_duplicates()获取所有存在的手机号,避免遗漏那些没有接听记录的号码。
  3. 左连接(how='left')会保留所有手机号,没有匹配到已接听日期的号码会自动填充NaN,正好符合你的需求。

方法二:GroupBy自定义Apply函数

如果需要更灵活的逻辑控制,可以用groupby.apply自定义处理每个分组:

import pandas as pd

def get_valid_max_date(group):
    # 提取当前分组中已接听的记录
    answered_subset = group[group['answered'] == 1]
    # 如果有已接听记录,返回最大日期;否则返回空值
    return answered_subset['call_date'].max() if not answered_subset.empty else pd.NA

# 应用自定义函数到每个手机号分组
result = df.groupby('phone_number').apply(get_valid_max_date).reset_index(name='max_call_date')

逻辑说明:

  • 对每个手机号的分组,先筛选出已接听的子数据集。
  • 判断子数据集是否为空:如果不为空,计算最大日期;为空则返回pd.NA(或np.nan,取决于你的pandas版本)。

验证结果

两种方法最终都会得到你期望的结果:

phone_numbermax_call_date
12313thJune
234NaN

注意:你的原始代码里写了Call_Date(首字母大写),但DataFrame的列名是call_date,要注意大小写一致,避免出现KeyError。

内容的提问来源于stack exchange,提问作者coder_bg

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.01 02:07:50