如何用变量/函数简化Pandas多列.between()日期范围过滤?
解决方法
核心问题
pd.Series.between() 需要传入两个独立参数(左边界和右边界),直接传元组会被当成单个参数导致报错,用*操作符解包元组就能解决这个问题。
实现步骤
- 定义日期范围变量
把重复的日期范围存成元组,后续只需修改变量值即可批量更新:
# 定义Q2 2023和Q2 2024的日期范围 q2_2023 = ("6/1/2023", "6/30/2023") q2_2024 = ("6/1/2024", "6/30/2024")
- 用解包操作调用between
通过*把元组拆成两个独立参数传给between():
TimeFrame = ( WFRL["EOD (HIRE_DT)"].between(*q2_2023) | WFRL["Grade Entry Date"].between(*q2_2023) | WFRL["Step Date"].between(*q2_2023) | WFRL["WGI Due Dt"].between(*q2_2024) )
进阶优化(多列批量处理)
如果需要过滤的日期列很多,可以用循环简化代码,避免重复写between():
import pandas as pd # 先把日期列转为datetime类型(推荐,避免字符串比较的潜在问题) date_columns = ["EOD (HIRE_DT)", "Grade Entry Date", "Step Date", "WGI Due Dt"] WFRL[date_columns] = WFRL[date_columns].apply(pd.to_datetime) # 定义日期范围 q2_2023 = ("2023-06-01", "2023-06-30") q2_2024 = ("2024-06-01", "2024-06-30") # 批量生成前3列的过滤条件 common_cols = ["EOD (HIRE_DT)", "Grade Entry Date", "Step Date"] common_condition = WFRL[common_cols].apply(lambda col: col.between(*q2_2023)).any(axis=1) # 合并最终条件 TimeFrame = common_condition | WFRL["WGI Due Dt"].between(*q2_2024)
内容的提问来源于stack exchange,提问作者NKME
相关产品推荐
相关产品推荐

