如何检查Pandas DataFrame不同日期列的先后顺序是否合规
Pandas日期校验实现方案
无需使用循环遍历,pandas内置的向量化比较操作是最适配该场景的方案,运算效率远高于循环,尤其适合大数据量场景。
第一步:转换日期列格式
首先需要将三个日期列从字符串格式转换为pandas datetime类型,避免字符串顺序比较出现逻辑错误:
import pandas as pd expeditions = pd.read_csv("https://raw.githubusercontent.com/rfordatascience/tidytuesday/master/data/2020/2020-09-22/expeditions.csv") # 转换日期列,errors='coerce'会自动将不合法的日期值转为空值NaT expeditions[['basecamp_date', 'highpoint_date', 'termination_date']] = expeditions[['basecamp_date', 'highpoint_date', 'termination_date']].apply(pd.to_datetime, errors='coerce')
第二步:实现校验逻辑
根据你的使用需求可以选择两种实现方式:
- 方式1:直接筛选出所有不符合规则的行,生成单独的DataFrame用于后续修正
# 筛选出basecamp日期不早于highpoint日期、或不早于termination日期的异常行 invalid_rows = expeditions[ (expeditions['basecamp_date'] >= expeditions['highpoint_date']) | (expeditions['basecamp_date'] >= expeditions['termination_date']) ]
- 方式2:在原DataFrame中新增校验标记列,方便后续对全量数据做过滤处理
# 新增列标记每行日期是否合法,合法为True,不合法为False expeditions['is_date_valid'] = ( (expeditions['basecamp_date'] < expeditions['highpoint_date']) & (expeditions['basecamp_date'] < expeditions['termination_date']) )
补充:空值处理调整
如果需要将日期为空(NaT)的行也判定为不合法,可以调整校验逻辑如下:
expeditions['is_date_valid'] = ( expeditions['basecamp_date'].notna() & expeditions['highpoint_date'].notna() & expeditions['termination_date'].notna() & (expeditions['basecamp_date'] < expeditions['highpoint_date']) & (expeditions['basecamp_date'] < expeditions['termination_date']) )
内容的提问来源于stack exchange,提问作者user17501078
相关产品推荐
相关产品推荐

