You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在R中堆叠特定命名的数据文件:保留ID变量并生成标识变量

解决R中数据堆叠并提取来源编号的问题

嘿,这事儿我熟!处理这种带编号的宽格式数据转长格式,用tidyverse里的pivot_longer函数就能轻松搞定,我之前做问卷数据分析经常这么操作。

方法一:用tidyverse(推荐,代码更直观)

首先确保你已经安装了tidyverse包,如果没装的话先跑这行:

install.packages("tidyverse")

假设你的数据框叫my_data,里面包含id变量和所有i1.1到i7.7的列。直接用下面的代码就能完成堆叠,同时提取原变量名末尾的数字:

library(tidyverse)

# 转换成长格式并提取来源编号
stacked_data <- my_data %>%
  pivot_longer(
    # 选中所有以i开头的变量,不用手动列全49个!
    cols = starts_with("i"),
    # 用正则表达式拆分变量名,直接提取组编号(i后面的数字)和来源编号(点后面的数字)
    names_to = c("group", "source_number"),
    names_pattern = "i(\\d+)\\.(\\d+)",
    # 把堆叠后的数值放到value列
    values_to = "value",
    # 自动把提取的字符转成整数类型,省得后续再处理
    names_transform = list(group = as.integer, source_number = as.integer)
  )

# 如果不需要group列(只保留id、source_number和value),可以加这行:
# stacked_data <- stacked_data %>% select(id, source_number, value)

代码解释:

  • cols = starts_with("i"):自动匹配所有以i开头的列,49个变量也不用一个个敲,太省心了。
  • names_pattern = "i(\\d+)\\.(\\d+)":这个正则表达式会把i1.3拆成两部分:1(i后面的数字)和3(点后面的数字),分别存到group和source_number列里。
  • names_transform:直接把提取的字符转成整数,避免后续还要手动转换类型。

方法二:只用base R(如果你不想装新包)

要是你不想用tidyverse,base R的reshape函数也能实现,就是代码可读性稍差一点:

# 选中所有i开头的列名
i_cols <- grep("^i", names(my_data), value = TRUE)
# 提取每个列名末尾的数字作为来源编号
source_nums <- as.integer(sub("i\\d+\\.(\\d+)", "\\1", i_cols))

# 转换成长格式
stacked_data <- reshape(
  my_data,
  varying = i_cols,
  v.names = "value",
  timevar = "source_number",
  times = source_nums,
  direction = "long",
  idvar = "id"
)

# 整理列顺序并去掉行名
stacked_data <- stacked_data[, c("id", "source_number", "value")]
row.names(stacked_data) <- NULL

两种方法都能得到你想要的结果:保留id变量,所有数值堆叠成一列,同时有source_number记录原变量名的末尾数字。

内容的提问来源于stack exchange,提问作者Daniel Rawlings

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 10:55:42