You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用tidyr将DataFrame重排为含特征全组合This is the way的4列格式?

解决方案

可以用 tidyr 结合 dplyr 高效实现这个需求,具体代码和步骤如下:

代码实现

library(tidyr)
library(dplyr)

# 原始数据
df <- data.frame(id=1:2,
                 feature1=1:2,
                 feature2=4:5,
                 feature3=7:8)

# 转长格式,统一整理特征名称与对应值
df_long <- df %>%
  pivot_longer(cols = starts_with("feature"), 
               names_to = "feature", 
               values_to = "value")

# 自连接生成所有特征组合,并重命名列
df_goal <- df_long %>%
  inner_join(df_long, by = "id", suffix = c("_1", "_2")) %>%
  rename(x = feature_1,
         y = feature_2,
         value1 = value_1,
         value2 = value_2) %>%
  select(value1, value2, x, y)

# 查看结果
head(df_goal)

逻辑说明

  1. 转长格式:pivot_longer 将宽表中的多个特征列收拢为两列(特征名称、特征值),方便后续组合操作。
  2. 自连接生成组合:基于 id 做自连接,自动生成所有特征的两两组合(包含同一特征自身的组合),完全覆盖你需要的所有组合场景。
  3. 列重命名与筛选:调整列名匹配目标格式,最后按需求选择列即可。

如果只需要固定某一特征作为 x(比如示例中仅保留x="feature1"的情况),可以在最后加一层过滤:

df_goal_filtered <- df_goal %>%
  filter(x == "feature1")

这种向量化操作对10k行的数据处理效率很高,完全适配你的场景。

内容的提问来源于stack exchange,提问作者nhaus

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 14:21:30