如何为Pandas DataFrame指定列匹配值添加前缀与递增序号
Pandas 处理指定列匹配值批量替换方案
直接按如下代码实现即可,逻辑完全匹配「匹配sample的行加固定前缀+递增序号、非匹配行保留原值」的需求:
# 筛选出columnname列包含'sample'的行 match_mask = df["columnname"].str.contains("sample", na=False) # 对匹配行按出现顺序生成从1开始的递增序号,拼接成目标格式替换原值 df.loc[match_mask, "columnname"] = "AAAA-sample" + match_mask.cumsum().astype("string")
逻辑说明
- 用
str.contains()做匹配可以覆盖所有包含sample文本的单元格,如果你只需要精确匹配值等于sample的行,把掩码定义行替换成match_mask = df["columnname"] == "sample"即可 match_mask.cumsum()会按行遍历顺序,每遇到一个匹配行就累加1,天然实现从1开始的递增计数,不需要额外写循环- 非匹配行不会被
loc选中,会自动保留原有值
测试结果
用你给出的原始列值测试,运行后列值顺序如下:
- AAAA-sample1
- FFFF-apple
- DDDD-orange
- AAAA-sample2
- BBBB-banana
- AAAA-sample3
- RRRR-berries
- AAAA-sample4
你给出的期望结果中存在两处和规则描述冲突的笔误:非sample行
RRRR-berries被改为CCCC-berries、最后一个sample对应序号跳为5,上述代码严格遵循你描述的规则实现,如果需要自定义序号跳过规则、非匹配行修改规则,在现有掩码基础上叠加判断条件即可。
内容的提问来源于stack exchange,提问作者Ziggy
相关产品推荐
相关产品推荐

