You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R中使用stringr::str_locate获取子串位置出错,如何得到正确结果?

问题分析与解决方案

你的代码出问题的核心在于没搞清楚str_locate()的向量化返回格式,以及dplyr中mutate的工作逻辑——我来帮你拆解清楚:

str_locate()对字符串向量操作时,会返回一个n行2列的矩阵(n是向量的长度),每一行对应一个字符串的匹配起始、结束位置。当你在mutate里直接写str_locate(x, "de")[1]时,你提取的是这个矩阵的第一个元素(也就是第一行第一列的3),然后dplyr会把这个单一值重复填充到所有行,所以两行结果都是3。

要得到每行字符串中"de"的起始位置,有两种简单的解决方法:

方法1:提取矩阵的第一列

直接取str_locate返回矩阵的第一列(对应匹配的起始位置),这样就能得到每个字符串的匹配起始位置向量:

library(tibble)
library(stringr)

t1 <- tibble(x = c("aaded", "dedere"))
bb <- t1 %>% mutate(de_start = str_locate(x, "de")[, 1])
bb

运行结果:

# A tibble: 2 x 2
  x      de_start
  <chr>     <int>
1 aaded         3
2 dedere        1

方法2:用rowwise()逐行处理

通过rowwise()让dplyr对每行单独执行操作,这样str_locate(x, "de")[1]就会取当前行匹配结果的第一个元素:

bb <- t1 %>% 
  rowwise() %>% 
  mutate(de_start = str_locate(x, "de")[1]) %>% 
  ungroup()  # 记得取消逐行模式,避免影响后续操作
bb

这个方法也能得到和上面完全一致的正确结果。

内容的提问来源于stack exchange,提问作者linuxiaobai

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.08 15:13:10