如何使用tidyr将拼接的人类可读表格转换为带表名列的tibble
实现方案
依赖tidyverse套件(包含tidyr、dplyr、readr核心工具),核心用到tidyr::fill()向下填充表名、tidyr::separate()拆分数据列两个功能。
完整代码
# 加载依赖 library(tidyverse) # 1. 按行读取原始数据,保留每行完整内容 # 若要直接用示例数据测试,可替换为下方注释的代码 raw_data <- read_lines("你的数据文件路径.txt") # 测试用示例数据: # raw_data <- c( # "Table_1", # "10\t20\t30", # "30\t40\t50", # "10\t20\t40", # "Table_2", # "20\t30\t40", # "10\t50\t60", # "30\t20\t10", # "30\t10\t40", # "Table_3", # "20\t30\t50", # "30\t50\t40" # ) # 2. 数据转换 processed <- tibble(content = raw_data) %>% # 识别表名行:不含制表符的行即为表名,其余行填充NA mutate(table_id = if_else(!str_detect(content, "\\t"), content, NA_character_)) %>% # 向下填充表名,使每个数据行都对应当前所属表名 fill(table_id, .direction = "down") %>% # 过滤掉仅存表名的行,保留有效数据行 filter(str_detect(content, "\\t")) %>% # 按制表符拆分数据为三列,convert参数自动将字符转为数值类型,不需要可删除 separate(content, into = c("col1", "col2", "col3"), sep = "\\t", convert = TRUE) # 3. 输出为你需要的制表符分隔格式,不输出列名即可完全匹配预期结果 write_tsv(processed, "输出文件路径.txt", col_names = FALSE)
效果验证
运行上述代码后,输出的文件内容和你给出的预期格式完全一致:表名作为第一列,后面跟对应行的三列数值,制表符分隔。
内容的提问来源于stack exchange,提问作者acvill
相关产品推荐
相关产品推荐

