如何用R的arrow包读取无法载入内存的.fwf固定宽度文件?
使用Arrow包读取超大固定宽度(FWF)文件的实现方案
现状说明
目前Arrow包没有内置的read_fwf_arrow()函数,但可以通过将文件按单列读取,再结合字段字典解析固定宽度字段的方式实现需求,全程支持懒加载,不会一次性将数据载入内存。
实现步骤与代码
1. 预处理字段字典
首先从字典文件中计算每个字段的起始和结束位置:
library(arrow) library(dplyr) library(data.table) # 读取字段字典 dic <- fread('fwf_dictionary.csv') %>% # 计算每个字段的起始、结束位置(从1开始计数) mutate( start = cumsum(lag(length, default = 0)) + 1, end = cumsum(length) )
2. 自定义FWF读取函数
编写函数实现单文件的固定宽度解析,全程基于Arrow的懒加载数据集操作:
read_fwf_arrow <- function(file_path, dic) { # 将整个文件读取为单列(选一个文件中绝对不存在的分隔符,避免拆分行) raw_data <- read_delim_arrow( file_path, delim = "\0", # 空字符,几乎不会出现在常规文本文件中 col_names = "raw_line", col_types = schema(raw_line = string()), skip_empty_rows = TRUE ) # 遍历字典,逐个提取固定宽度字段 parsed_data <- raw_data for (i in seq_len(nrow(dic))) { var_name <- dic$varname[i] start_pos <- dic$start[i] end_pos <- dic$end[i] # 用Arrow支持的substr函数提取字段,支持懒执行 parsed_data <- parsed_data %>% mutate(!!var_name := substr(raw_line, start_pos, end_pos)) } # 移除原始的单行文本列 parsed_data %>% select(-raw_line) }
3. 批量处理多文件
读取目录下所有FWF文件并合并,结果仍为Arrow懒加载数据集:
# 目标文件路径 p <- 'path_to_my_files' # 获取所有txt格式的FWF文件 file_list <- list.files(p, pattern = "\\.txt$", full.names = TRUE) # 批量读取并合并(map_dfr会保留Arrow数据集的懒加载特性) library(purrr) combined_data <- map_dfr(file_list, ~read_fwf_arrow(.x, dic)) # 可选:将解析后的数据保存为Parquet格式,方便后续高效读取 write_dataset(combined_data, "parsed_fwf_data", format = "parquet")
关键注意事项
- 分隔符选择:必须确保所选分隔符(如
\0)绝对不会出现在FWF文件中,否则会导致行被错误拆分 - 类型转换:如果字段需要特定数据类型(如整数、日期),可以在
mutate时添加转换,例如!!var_name := as.integer(substr(raw_line, start_pos, end_pos)) - 内存友好:所有解析操作都是懒执行的,只有调用
collect()时才会将数据载入内存,适合处理远超内存容量的大文件
内容的提问来源于stack exchange,提问作者LucasMation
相关产品推荐
相关产品推荐

