You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Python中逐行检测标题是否包含关键词(适配印度语)

解决印度语关键词部分匹配失效问题

你的代码存在两个核心问题:一是循环逐key匹配会覆盖结果且效率低下,二是未处理多语言字符匹配的潜在编码/正则转义问题,导致印度语关键词无法被正确识别。

修复方案

直接将所有关键词整合成一个正则表达式批量匹配,同时处理特殊字符转义,确保Unicode字符(印度语)能被正确识别:

import pandas as pd
import re

# 假设你的数据集是df
# 提取所有关键词并转义正则特殊字符(避免.+*等符号干扰匹配)
escaped_keys = [re.escape(key) for key in df['key'].dropna().tolist()]
# 合并为正则匹配模式,用|分隔表示"或"逻辑
match_pattern = '|'.join(escaped_keys)

# 一次性检测所有标题是否包含任意关键词,支持印度语等Unicode字符
df['match_result'] = df['title'].str.contains(
    match_pattern,
    case=False,
    na=False,
    regex=True  # 明确启用正则匹配(默认已开启,这里显式声明更清晰)
)

# 查看结果
print(df[['title', 'key', 'match_result']])

关键说明

  1. 正则转义:用re.escape()处理关键词,避免关键词中的特殊字符(如印度语中的标点、特殊符号)被当作正则语法解析,导致匹配失败。
  2. 批量匹配:避免循环逐行赋值,一次性完成所有关键词的匹配,既提升效率,也防止循环中覆盖结果的问题。
  3. Unicode支持:Python3 和 pandas 默认支持 Unicode 字符,只要你的数据集编码是UTF-8(确保df['key']和df['title']是str类型而非字节类型),印度语字符就能被正确识别匹配。

额外排查点

如果仍无法匹配,检查以下内容:

  • 确认数据集编码:用df.dtypes查看key和title列是否为object(str)类型,若为字节类型需先解码为字符串。
  • 检查关键词与标题的字符一致性:比如是否存在全角/半角差异、拼写错误(印度语的相似字符容易混淆)。

内容的提问来源于stack exchange,提问作者riya23

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 00:14:58