You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Pandas DataFrame筛选两个日期区间内的所有行

筛选Pandas DataFrame中日期区间内的行(以2017加州野火数据为例)

刚好最近处理过类似的日期筛选需求,结合你给出的2017加州野火数据预处理代码,我来一步步帮你实现目标。首先得先把你的预处理代码补全(原代码缺了关键的导入和异常处理),然后再演示几种实用的筛选方法。


第一步:补全并完善预处理代码

原代码里用到了dateutil.parser.parse但没导入这个库,而且直接解析可能遇到异常,所以先补全并优化:

import pandas as pd
from pandas.io.html import read_html
from datetime import datetime
import dateutil.parser  # 补上缺失的导入

# 加载维基百科上的野火数据
wiki_fires = pd.read_html("https://en.wikipedia.org/wiki/2017_California_wildfires")
wildfire_df = wiki_fires[1]

# 修复列名(原表格第一行是列名)
wildfire_df.columns = wildfire_df.iloc[0]
wildfire_df = wildfire_df[1:]

# 安全解析日期:失败时返回空时间值(pd.NaT)
def safe_parse_date(date_str):
    try:
        return dateutil.parser.parse(date_str)
    except (ValueError, TypeError):
        return pd.NaT

# 转换日期列为datetime类型
wildfire_df["Start Date"] = wildfire_df["Start Date"].apply(safe_parse_date)
wildfire_df["Containment Date"] = wildfire_df["Containment Date"].apply(safe_parse_date)

# 可选:去掉日期解析失败的无效行
wildfire_df = wildfire_df.dropna(subset=["Start Date", "Containment Date"])

第二步:三种实用的日期区间筛选方法

方法1:布尔索引(最直观)

直接对日期列做范围判断,用布尔值过滤行。注意要用&做元素级逻辑运算,每个条件加括号:

# 定义你要筛选的日期区间
start_date = datetime(2017, 7, 1)  # 起始日期:2017年7月1日
end_date = datetime(2017, 10, 31) # 结束日期:2017年10月31日

# 筛选"Start Date"在区间内的所有行
filtered_fires = wildfire_df[(wildfire_df["Start Date"] >= start_date) & (wildfire_df["Start Date"] <= end_date)]

方法2:用loc灵活筛选行+列

如果需要同时指定要保留的列,loc方法会更清晰:

# 筛选日期区间内的行,同时只保留核心列
filtered_fires = wildfire_df.loc[
    (wildfire_df["Start Date"] >= start_date) & (wildfire_df["Start Date"] <= end_date),
    ["Name", "Start Date", "Containment Date", "Acres Burned"]
]

方法3:between方法简化代码

Pandas的Series.between()可以直接判断元素是否在两个值之间,代码更简洁:

# between默认包含两端(inclusive=True),如果要排除两端可以设置inclusive="neither"
filtered_fires = wildfire_df[wildfire_df["Start Date"].between(start_date, end_date)]

小提示

  • 一定要确保日期列是datetime类型,否则比较会出错。可以用wildfire_df.dtypes检查列类型。
  • 如果你的日期是字符串格式,也可以用pd.to_datetime()批量转换,比如:wildfire_df["Start Date"] = pd.to_datetime(wildfire_df["Start Date"], errors="coerce")(errors="coerce"会把解析失败的转为pd.NaT)。

内容的提问来源于stack exchange,提问作者db4

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 04:11:13