You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Pandas DataFrame中高效定位并删除指定条件行块的问题

高效删除符合条件的行块解决方案

针对你遇到的循环效率低、索引错误问题,我们可以利用 pandas 的向量化操作实现无循环、高效的行块删除,避免频繁修改 DataFrame 导致的性能损耗和索引问题。

核心思路

  1. 标记需要删除的前置行:每个 Moved=-1 的位置向前追溯最多100行,标记这些行待删除。
  2. 标记坏数据块的结束点:找到连续100行 Moved=0 的起始位置,作为坏数据块的结束边界。
  3. 标记坏数据块的中间行:从 Moved=-1 的位置开始,到上述结束边界之前的所有行标记为待删除。
  4. 合并标记并过滤数据:将所有待删除的行标记合并,保留未标记的行。

完整代码实现

import pandas as pd
import numpy as np

# 假设你的数据存储在 df 中
# df = pd.read_csv("your_data.csv", index_col=0)

window_size = 100

# 步骤1:标记每个坏数据起始点向前100行的区域
reversed_df = df.iloc[::-1]
backward_mask_reversed = reversed_df['Moved'].eq(-1).rolling(window=window_size, min_periods=1).max().astype(bool)
backward_mask = backward_mask_reversed.iloc[::-1]

# 步骤2:找到连续100行Moved=0的起始位置
rolling_non_zero = df['Moved'].ne(0).rolling(window=window_size, min_periods=window_size).sum()
start_of_100zeros = (rolling_non_zero == 0).shift(-(window_size-1), fill_value=False)

# 步骤3:标记从坏数据起始到结束边界前的所有行
bad_start_indices = df.index[df['Moved'] == -1]
end_indices = df.index[start_of_100zeros]

change = pd.Series(0, index=df.index)
change.loc[bad_start_indices] = 1
change.loc[end_indices] = -1

cumulative = change.cumsum().clip(lower=0)
in_bad_block = cumulative > 0

# 步骤4:合并所有待删除标记并过滤数据
delete_mask = backward_mask | in_bad_block
clean_df = df[~delete_mask].copy()

代码说明

  • 向量化操作:全程使用 pandas 的内置方法(如 rolling、cumsum),避免循环,大幅提升处理速度。
  • 无索引错误:基于原始索引进行标记,不会因频繁删除行导致索引混乱。
  • 边界处理:
    • 若坏数据起始点在数据集前100行,自动从数据集开头开始标记。
    • 若坏数据块后无连续100行0,则自动删除到数据集末尾。
    • 处理重叠的坏数据块,确保所有需要删除的行都被标记。

对比原方法的优势

  1. 效率提升:向量化操作的时间复杂度远低于循环,处理大型数据集时差距尤为明显。
  2. 稳定性:无需反复修改原 DataFrame,避免索引越界、数据丢失等问题。
  3. 可维护性:代码逻辑清晰,便于后续调整参数(如修改追溯行数、连续0的判定条件)。

内容的提问来源于stack exchange,提问作者Leland

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.19 17:15:36