如何在R中提取拆分含多值列后的单个基因列表?
在R中拆分分号分隔的基因列
方法1:使用tidyverse工具(推荐,保留关联数据)
如果需要拆分后保留基因对应的Log2FC、SD等关联信息,或者后续要继续做数据处理,tidyr::separate_rows是最便捷的选择:
先构造和你数据结构一致的可复现示例:
df <- data.frame( Genes = c("A2M", "Aars", "Actb;Actg1", "Cxcl1;Cxcl2;Cxcl3"), Log2FC = c(2, 4, 3, 5), SD = c(3, 4, 5, 6), Pvalue = c(0.001, 0.001, 0.001, 0.001), stringsAsFactors = FALSE )
执行拆分操作:
library(tidyverse) # 拆分基因列,每个基因单独占一行,其他列自动复制对应值 df_split <- df %>% separate_rows(Genes, sep = ";") # 提取纯基因列表 gene_list <- df_split$Genes
方法2:基础R实现(仅提取基因列表)
如果只需要单个基因的向量,不需要保留其他列信息,用基础R的strsplit+unlist即可快速实现:
# 拆分基因列得到嵌套列表 split_genes <- strsplit(df$Genes, split = ";") # 把列表扁平化为一维向量 gene_list <- unlist(split_genes)
两种方法最终得到的gene_list结果一致:
[1] "A2M" "Aars" "Actb" "Actg1" "Cxcl1" "Cxcl2" "Cxcl3"
内容的提问来源于stack exchange,提问作者Allen Schweickart
相关产品推荐
相关产品推荐

