如何在pandas中基于列字符串最后一次出现位置提取dataframe子集
实现方法(Pandas环境)
首先我们可以通过定位name列中Sta最后一次出现的索引,再对原DataFrame做切片即可得到目标结果,代码示例如下:
import pandas as pd # 构造你的示例DataFrame data = { "ID": [1]*10, "name": ["Sta", "Danny", "Sta", "elle", "Sta", "jake", "Andy", "Adam", "blah", "blahblah"], "number": [2, 5, 2, 4, 2, 9, 11, 22, 44, 66] } df = pd.DataFrame(data) # 1. 找到name列最后一次出现Sta的索引 last_sta_index = df[df["name"] == "Sta"].index.max() # 2. 从首行切片到该索引位置(pandas的loc切片包含首尾边界) result_df = df.loc[:last_sta_index] # 输出验证结果 print(result_df)
逻辑说明
- 第一步先筛选出所有
name值为Sta的行,取这些行索引的最大值,即为Sta最后一次出现的位置 - pandas的
loc按索引切片是左闭右闭规则,所以df.loc[:last_sta_index]会包含从第一行到最后一次Sta出现行的所有记录 - 如果需要处理原数据中不存在
Sta的边界场景,可以增加判断:如果last_sta_index是空值,可按需返回空DataFrame或者原数据即可
内容的提问来源于stack exchange,提问作者Rach
相关产品推荐
相关产品推荐

