如何用同一行另一变量定义的正则表达式匹配DataFrame字符变量?
实现每行正则匹配的Flag列
嘿,这事儿好办!用pandas的apply配合Python的re正则模块就能轻松实现你要的功能,我给你一步步拆解:
首先,确保你导入了需要的模块(除了pandas,还要加re):
import pandas as pd import re
接下来,写一个小函数用来逐行检查匹配情况:
def check_regex_match(row): # 这里用re.search检查字符串中是否存在匹配的正则片段 # 加上re.IGNORECASE是因为你的示例里大小写不一致但需要匹配,不需要的话可以删掉这个参数 match_result = re.search(row['myregex'], row['mystring'], flags=re.IGNORECASE) # 匹配到就返回1,没匹配到返回0,也可以直接返回布尔值True/False return 1 if match_result else 0
然后把这个函数应用到你的DataFrame上,生成新的flag列:
mydata['flag'] = mydata.apply(check_regex_match, axis=1)
运行完之后,你的DataFrame就会变成你想要的样子:
myregex mystring flag 0 hello.[0-9] heLLohelloy1 1 1 ulla hAllohallo 0
额外小提示
- 如果你需要严格区分大小写匹配,直接去掉
flags=re.IGNORECASE参数就行。 - 要是你要求正则必须从字符串开头就完全匹配,把
re.search换成re.match就可以。 - 嫌函数麻烦?用lambda一行搞定也没问题:
mydata['flag'] = mydata.apply(lambda x: 1 if re.search(x['myregex'], x['mystring'], re.IGNORECASE) else 0, axis=1)
内容的提问来源于stack exchange,提问作者ℕʘʘḆḽḘ
相关产品推荐
相关产品推荐

