如何在R中对多文件夹TXT文件列计算并保存新列
问题解决与完整代码实现
错误原因分析
你遇到的Reduce报错是因为调用时缺少了第二个参数exprs。Reduce的正确语法是Reduce(func, x, init),其中x是要迭代的向量/列表。你的代码只传了init,没传exprs,所以触发"argument 'x' is missing"错误。
更关键的是,你不应该把所有文件合并成一个mydata——因为需求是按原文件夹结构保存每个处理后的文件,所以需要逐个处理单个文件,而非合并后再统一处理。
完整解决方案代码
以下代码实现了逐个读取文件、根据原列存在情况生成新列、并将处理后的文件保存回原文件夹(添加后缀避免覆盖原文件):
library(data.table) # 设置数据根目录(替换为你的实际路径) root_dir <- "F:/BSRN_txt" # 递归获取所有txt文件的完整路径 all_files <- list.files(path = root_dir, pattern = "\\.txt$", full.names = TRUE, recursive = TRUE) # 定义单个文件的处理函数 process_file <- function(file_path) { # 读取文件:自动跳转到指定表头行的下一行 dt <- fread(file_path, skip = "Date/Time\tAU [AU]") # 仅当原列存在时生成对应新列 if ("ABC" %in% colnames(dt)) { dt[, ABC_new := 1.5 * SA * u^1.1 + 700] } if ("DEF" %in% colnames(dt)) { dt[, DEF_new := SA * u^2.5] } if ("MNO" %in% colnames(dt)) { dt[, MNO_new := 1.8 * SA * u^1.5 + 40] } # 生成输出路径:保留原文件夹结构,添加处理后缀 output_path <- gsub("\\.txt$", "_processed.txt", file_path) # 保存处理后的文件(用制表符分隔匹配原格式) fwrite(dt, output_path, sep = "\t") } # 批量处理所有文件 lapply(all_files, process_file)
代码关键点说明
- 智能文件读取:
fread的skip参数支持直接传入表头字符串,自动定位目标行并从下一行开始读取,无需手动计算跳过行数。 - 条件列生成:用
if判断原列是否存在,避免因列缺失导致的报错,同时只执行必要的计算。 - 路径保留:通过
gsub修改文件名后缀,确保原文件不被覆盖,同时完全保留原文件夹层级结构。 - 高效批量处理:使用
lapply遍历所有文件路径,自动化完成全量文件的处理与保存。
原代码的其他问题修正
- 原代码中用大写
X代替乘法符号*,属于语法错误,已替换为正确的*。 - 原代码中
adjust_column_names函数未正确返回修改后的数据集,现在直接在原data.table上修改,更简洁高效。
内容的提问来源于stack exchange,提问作者Alexia k Boston
相关产品推荐
相关产品推荐

