如何在R语言中提取列中指定片段后的所有字符?
提取目标内容的正则方案
从你用的
COLUMN$Entity语法来看应该是在R里操作,直接用下面的gsub命令就能提取出Court House:gsub("^.*, \\S+ (.*)$", "\\1", COLUMN$Entity)拆解下这个正则的作用:
^.*,:匹配从字符串开头到「逗号+空格」的所有内容,也就是示例里的Fake City,\\S+:匹配逗号后面第一个不带空格的字符串(示例里的TX)(.*)$:把这之后到字符串结尾的所有内容(也就是你要的Court House)捕获起来- 最后用
\\1替换整个字符串,就只剩捕获到的目标内容了
这个写法不用纠结州缩写的长度,只要机构名称是跟在逗号后第一个单词的后面,都能准确提取。
内容的提问来源于stack exchange,提问作者Antonio
相关产品推荐
相关产品推荐

