You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言:提取ID1/ID2唯一值并实现行绑定数据处理需求

解决方法

给定的数据集里,R会自动把重复的S1列重命名为S1和S1.1,先基于这个前提处理需求:

1. 提取并合并ID条目

我们需要为每个name整合其ID 1和ID 2的有效值,去掉缺失值后合并为单个条目,最终得到8条有效记录(排除无有效ID的njam):

library(dplyr)
library(tidyr)

# 提取ID列并整理
id_entries <- df %>%
  select(name, `ID 1`, `ID 2`) %>%
  # 将ID列转成长格式,统一处理非NA值
  pivot_longer(cols = c(`ID 1`, `ID 2`), values_to = "id") %>%
  filter(!is.na(id)) %>%
  # 按name分组,合并同一name下的所有唯一ID为单个条目
  group_by(name) %>%
  summarise(combined_ids = paste(unique(id), collapse = ", ")) %>%
  ungroup()

# 输出结果,共8条记录
print(id_entries)

2. 生成最终数据集

将整理后的ID数据与原始数据中的city、S列合并,得到最终数据集:

# 整理原始数据的S列,合并每个name的有效S值
s_entries <- df %>%
  select(name, S1, S1.1) %>%
  pivot_longer(cols = c(S1, S1.1), values_to = "s_values") %>%
  filter(!is.na(s_values)) %>%
  group_by(name) %>%
  summarise(combined_s = paste(unique(s_values), collapse = ", ")) %>%
  ungroup()

# 合并所有数据,保留唯一的城市信息
final_df <- id_entries %>%
  left_join(s_entries, by = "name") %>%
  left_join(df %>% select(city, name) %>% distinct(), by = "name") %>%
  # 调整列顺序,让结构更清晰
  relocate(city, name, combined_ids, combined_s)

print(final_df)

如果不需要合并S值,只想保留原始行信息并绑定ID,也可以用以下方式:

# 提取所有非NA的ID,按name关联
unique_id_list <- df %>%
  select(name, `ID 1`, `ID 2`) %>%
  pivot_longer(cols = c(`ID 1`, `ID 2`), values_to = "unique_id") %>%
  filter(!is.na(unique_id)) %>%
  distinct(name, unique_id)

# 关联原始数据的其他列,生成最终数据集
final_dataset <- df %>%
  select(city, name, S1, S1.1) %>%
  distinct(name, .keep_all = TRUE) %>%
  left_join(unique_id_list, by = "name") %>%
  filter(!is.na(unique_id))

print(final_dataset)

内容的提问来源于stack exchange,提问作者potro

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.27 11:57:45