You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在R语言中从混合格式姓名列提取姓氏的方法

提取混合格式姓名中的姓氏

针对你的数据集,这里提供两种在R中提取姓氏的方案:

方法一:使用Base R(无需额外包)

利用正则表达式匹配两种姓名格式,通过sub()函数直接提取姓氏:

df$last_name <- sub("^(.*?),.*$|.*\\s(.*)$", "\\1\\2", df$name)

正则逻辑说明:

  • ^(.*?),.*$:匹配「姓氏, 名字」格式的字符串,捕获逗号前的部分(即姓氏)
  • .*\\s(.*)$:匹配「名字 姓氏」格式的字符串,捕获空格后的部分(即姓氏)
  • \\1\\2:优先取第一个模式匹配的结果,无匹配时取第二个模式结果;单姓名场景下两个模式都不触发,sub()直接返回原字符串,正好符合需求

运行后结果:

> df
  id         name last_name
1  1   Jack Smith      Smith
2  2   May, Flora        May
3  3      Jackson    Jackson
4  4 Baker, Gavin       Baker
5  5        Walls      Walls

方法二:使用tidyverse(stringr包)

如果习惯tidyverse语法,可用stringr::str_extract()结合正则实现:

library(tidyverse)

df <- df %>%
  mutate(last_name = str_extract(name, "^[^,]+(?=,)|\\b\\w+$"))

正则逻辑说明:

  • ^[^,]+(?=,):匹配逗号前的所有字符(正向预查确保后方存在逗号)
  • \\b\\w+$:匹配字符串的最后一个单词(对应「名字 姓氏」格式的姓氏)
  • 两个模式用|分隔,str_extract()返回第一个匹配结果,单姓名场景会直接匹配整个字符串

运行后同样可得到目标结果。

内容的提问来源于stack exchange,提问作者amisos55

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.27 05:10:02