You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何编写Regex按行尾字符串条件分组匹配提取对应姓名

问题根源

你写的正则([US]$)([A-Z][a-z]+)无法生效的核心原因有3个:

  • 匹配顺序颠倒:正则默认按文本从左到右的顺序匹配,你的目标文本里姓名在行首、US标记在行尾,你把匹配US的规则放在前面、匹配姓名的规则放在后面,永远无法命中对应内容
  • 字符类用法错误:[US]代表匹配单个字符(匹配U或者S其中一个),并非匹配字符串US
  • 规则缺失:没有匹配姓名和居住地之间的: 分隔符,也没有适配姓名是「名+姓」两个单词的结构;如果不开启多行匹配模式,$只会匹配整个文本的最末尾,无法匹配每一行的行尾。
可行方案

首先需要在正则匹配时开启多行匹配模式(Python中对应re.M/re.MULTILINE标志),使用如下正则即可提取所有居住地为US的人员姓名:

^([A-Za-z ]+): US$

各部分规则说明:

  • ^:在多行模式下匹配每一行的开头
  • ([A-Za-z ]+):捕获组,匹配行首到冒号前的所有英文字母和空格,也就是你需要的姓名内容
  • : US:匹配姓名后固定的分隔符+目标居住地标记
  • $:在多行模式下匹配当前行的行尾

Python调用示例

import re

dataset = """Mark Samson: CA
Sam Smith: US
Dawn Watterton: CA
Neil Shughar: CA
Fennial Fontaine: US"""

# 开启多行匹配模式,提取所有符合条件的姓名
us_residents = re.findall(r"^([A-Za-z ]+): US$", dataset, flags=re.M)
print(us_residents)
# 输出: ['Sam Smith', 'Fennial Fontaine']

如果你的数据集里姓名可能包含点、连字符等特殊字符,可以把姓名匹配部分换成更通用的(.+),写成^(.+): US$,只要姓名本身不包含冒号就不会出现匹配错误。


内容的提问来源于stack exchange,提问作者124C41

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.30 21:21:24