如何使用tidyr::separate拆分包含数字的因子列
R tidyr::separate 拆分字符与数字混合列实现方案
你可以使用零宽断言正则表达式作为sep参数的值,精准匹配非数字内容和数字内容的交界位置,不会消耗任何原始字符,刚好实现两列拆分:
separate(x, into = c("fctr", "number"), sep = "(?<=[^0-9])(?=[0-9])", convert = TRUE)
参数说明
- 正则
(?<=[^0-9])(?=[0-9])的作用是定位「前一位为非数字、后一位为数字」的零宽位置,以此作为拆分边界,不会丢失原始内容 - 额外添加
convert = TRUE参数,可自动将拆分出的number列转换为数值类型,无需二次处理
适配week_days列场景
如果你的原始列内容为Monday1、Tuesday2这类「文本在前、数字在后」的格式,运行上述代码后可直接得到:
fctr列:保留Monday、Tuesday等文本内容number列:存储对应提取出的数字值
内容的提问来源于stack exchange,提问作者Chrisabe
相关产品推荐
相关产品推荐

