如何用tidyr将DataFrame重排为含特征全组合This is the way的4列格式?
解决方案
可以用 tidyr 结合 dplyr 高效实现这个需求,具体代码和步骤如下:
代码实现
library(tidyr) library(dplyr) # 原始数据 df <- data.frame(id=1:2, feature1=1:2, feature2=4:5, feature3=7:8) # 转长格式,统一整理特征名称与对应值 df_long <- df %>% pivot_longer(cols = starts_with("feature"), names_to = "feature", values_to = "value") # 自连接生成所有特征组合,并重命名列 df_goal <- df_long %>% inner_join(df_long, by = "id", suffix = c("_1", "_2")) %>% rename(x = feature_1, y = feature_2, value1 = value_1, value2 = value_2) %>% select(value1, value2, x, y) # 查看结果 head(df_goal)
逻辑说明
- 转长格式:
pivot_longer将宽表中的多个特征列收拢为两列(特征名称、特征值),方便后续组合操作。 - 自连接生成组合:基于
id做自连接,自动生成所有特征的两两组合(包含同一特征自身的组合),完全覆盖你需要的所有组合场景。 - 列重命名与筛选:调整列名匹配目标格式,最后按需求选择列即可。
如果只需要固定某一特征作为 x(比如示例中仅保留x="feature1"的情况),可以在最后加一层过滤:
df_goal_filtered <- df_goal %>% filter(x == "feature1")
这种向量化操作对10k行的数据处理效率很高,完全适配你的场景。
内容的提问来源于stack exchange,提问作者nhaus
相关产品推荐
相关产品推荐

