You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何读取多CSV文件并添加文件名列且跳过前5行数据

批量合并CSV文件并添加文件名标识

以下是用data.table的rbindlist实现需求的完整代码,完美适配你的场景:

# 加载所需包
library(data.table)

# 获取目标文件夹下所有CSV文件的完整路径(可修改path参数指定文件夹)
csv_files <- list.files(path = ".", pattern = "\\.csv$", full.names = TRUE)

# 定义读取单个CSV的函数
read_csv_with_id <- function(file_path) {
  # 跳过前5行元数据,从第6行读取表头和数据
  dt <- fread(file_path, skip = 5)
  # 添加文件名列为唯一标识(保留完整文件名)
  dt[, file_id := basename(file_path)]
  # 可选:如果需要去掉.csv后缀,取消下面一行注释
  # dt[, file_id := sub("\\.csv$", "", basename(file_path))]
  return(dt)
}

# 批量读取所有文件并合并成一个规整数据框
combined_dt <- rbindlist(lapply(csv_files, read_csv_with_id))

关键细节说明

  • list.files的full.names=TRUE必须设置,确保拿到文件完整路径,避免读取时找不到文件的问题
  • fread是data.table包的高效读取函数,比基础read.csv速度快数倍,适合处理大量文件
  • skip=5精准跳过前5行无用元数据,直接从第6行读取表头和业务数据
  • basename(file_path)提取纯文件名(如BC_2017_10.csv),如果需要更简洁的标识,用sub去掉后缀即可
  • rbindlist会自动兼容不同文件列名不一致的情况,默认用NA填充缺失列;若要求列名完全一致,可添加fill=FALSE参数

如果文件有特殊编码需求,可在fread中加入encoding参数,比如encoding="UTF-8"或encoding="GBK"。

内容的提问来源于stack exchange,提问作者jrmetzge

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.04 11:28:06