You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas如何基于规则字典批量替换DataFrame列的拼写相似/错误值

pandas批量模糊替换Product列值实现方案

你需要的是包含关键词即替换的模糊匹配逻辑,而非默认的精确等值匹配,以下两种方案可直接复用:


方案1:正则批量替换(推荐,执行效率高)

利用pandas replace 方法的正则匹配能力,一次完成全列批量替换,适合数据量较大的场景:

# 构造包含匹配的正则规则:关键词前后可接任意字符
regex_rename_map = {f".*{key}.*": value for key, value in rename_product.items()}

# 执行正则替换,结果写回原列
df["Product"] = df["Product"].replace(regex_rename_map, regex=True)

注意:匹配优先级和字典键的顺序一致,如果单条数据可能同时命中多个关键词(比如同时包含Apple和Kiwi),请把优先级更高的匹配键放在字典靠前位置;如果关键词存在包含关系(比如同时有Apple和Apple Juice两个匹配规则),请把更长、更精确的键放在前面,避免被短规则提前匹配。


方案2:自定义函数匹配(适配性强,方便扩展规则)

如果需要处理大小写混乱、特殊字符干扰等复杂场景,可以写简单的判断函数逐行匹配,后续加特殊规则也更方便:

def format_product_name(origin_name):
    # 先清除前后多余空格,排除空格干扰
    clean_name = origin_name.strip()
    for keyword, target_name in rename_product.items():
        # 统一转小写判断,避免大小写不统一导致匹配失败(比如KIWI、apricot、APPLE这类写法都能命中)
        if keyword.lower() in clean_name.lower():
            return target_name
    # 未命中任何规则的条目保留原值,也可根据需求设置默认值如"其他品类"
    return origin_name

df["Product"] = df["Product"].apply(format_product_name)

结果校验

替换完成后可以执行以下命令检查结果,确认是否存在漏匹配的特殊值,补到rename_product字典中重新执行即可:

print(df["Product"].sort_values().unique())

内容的提问来源于stack exchange,提问作者SkarmoutsosV

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.30 08:09:20