You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从DataFrame中提取含重叠字符词列表的首个匹配项

解决DataFrame中重叠词汇的精准首次匹配问题

核心思路

参考词列表存在前缀重叠(比如ok是ok z的前缀),要实现精准匹配且保留首次出现的最长匹配项,关键是让正则优先匹配更长的词汇,避免短词提前匹配导致长词被遗漏。

具体步骤

  1. 对参考词列表按长度倒序排序:确保最长的词汇在匹配时被优先检查。
  2. 构建精准匹配的正则表达式:用re.escape处理每个词汇的特殊字符(比如空格),转成精确匹配模式,再用|拼接,让正则引擎优先匹配排在前面的长词汇。
  3. 提取首次匹配结果:用pandas的str.extract方法抓取第一个符合条件的匹配项,无匹配则返回空值。

代码实现

import pandas as pd
import re

# 参考词列表
word_list = ['ok', 'ok z', 'ok zz', 'ok zzz']
# 按字符串长度倒序排序,优先匹配长词
sorted_word_list = sorted(word_list, key=lambda x: len(x), reverse=True)
# 构建精确匹配的正则表达式
pattern = '|'.join([re.escape(word) for word in sorted_word_list])
# 示例DataFrame
df = pd.DataFrame({
    'Words': [
        'xxxxx xx xxxx ok zzz xxxx ok zzz xx',
        'xxxx xxxx xx xxxx ok z xxxx xx x',
        'xxx xx x xxxx ok zzz xxx xxx ok z xx'
    ]
})
# 提取首次匹配的结果
df['match'] = df['Words'].str.extract(f'({pattern})', expand=False)

print(df)

输出结果

Wordsmatch
xxxxx xx xxxx ok zzz xxxx ok zzz xxok zzz
xxxx xxxx xx xxxx ok z xxxx xx xok z
xxx xx x xxxx ok zzz xxx xxx ok z xxok zzz

说明

排序后的词列表为['ok zzz', 'ok zz', 'ok z', 'ok'],正则会先尝试匹配最长的ok zzz,只有当文本中不存在该词时,才会匹配更短的ok zz,以此类推,保证首次出现的最长匹配项被提取。

内容的提问来源于stack exchange,提问作者user22391597

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.13 15:10:02