You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何删除Pandas DataFrame中存在日内数据间断的日期行?

Pandas数据清洗:删除存在时段间断的日期数据

实现步骤

  1. 拆分日期与时段:从列1中分离出日期(前三位)和时段(后两位),用数学运算更高效:

    • 日期:df['date'] = df[1] // 100
    • 时段:df['period'] = df[1] % 100
  2. 识别存在间断的日期:按日期分组,检查每组内的时段序列是否存在相邻时段差大于1的情况(正常相邻时段差应为1):

    • 对每个分组的时段列计算相邻差值,判断是否有差值>1
    • 收集所有存在间断的日期
  3. 过滤数据:保留不存在间断的日期对应的所有行

完整代码

import pandas as pd

# 假设你的DataFrame名为df
# 1. 拆分日期和时段
df['date'] = df[1] // 100
df['period'] = df[1] % 100

# 2. 找出所有存在时段间断的日期
def has_gap(group):
    # 计算相邻时段的差值,排除第一个值(NaN)
    period_diff = group['period'].diff().dropna()
    # 检查是否有差值大于1的情况
    return (period_diff > 1).any()

# 分组应用函数,得到每个日期是否有间断的Series
date_has_gap = df.groupby('date').apply(has_gap)
# 提取需要删除的日期列表
bad_dates = date_has_gap[date_has_gap].index

# 3. 过滤数据,保留无间断的日期
clean_df = df[~df['date'].isin(bad_dates)]

# 可选:删除临时添加的date和period列
clean_df = clean_df.drop(['date', 'period'], axis=1)

代码说明

  • 拆分日期时段:用整数除法//100取前三位日期,取余%100取后两位时段,避免字符串转换的性能损耗
  • 检查间断:diff()计算相邻时段的差值,若差值>1说明中间缺失了时段;any()判断该日期是否存在这种情况
  • 过滤数据:用~df['date'].isin(bad_dates)筛选出不在删除列表中的日期行

内容的提问来源于stack exchange,提问作者Murilo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 03:01:11