如何按DataFrame指定规则批量保存list中的二进制文件?
批量保存数据库二进制文件解决方案
问题背景
现有如下结构的DataFrame,存储了文件的元数据:
df <- structure(list(PCL_ATTACHMENT_ID = c(1, 2, 3), PROTOCOL_ID = c(190, 190, 190), FILE_NAME = c("Recruitment Flyer Version 2.0.pdf", "Protocol - Sabc.pdf", "Consent- Sabc .pdf" ), MODIFIED_DATE = structure(c(1598377719, 1520781558, 1520781566 ), class = c("POSIXct", "POSIXt"), tzone = "")), row.names = c(NA, 3L), class = "data.frame")
已通过该DataFrame从Oracle数据库下载对应每行的原始二进制文件,存储在listraws列表中。需要自动遍历列表,将每个文件以PROTOCOL_ID为前缀、原始FILE_NAME为文件名保存(例如格式为190 - Recruitment Flyer Version 2.0.pdf),无需手动指定文件名和格式。
实现代码
基础for循环方案
逻辑清晰,适合新手理解:
# 遍历DataFrame的每一行 for (i in seq_len(nrow(df))) { # 拼接目标文件名 target_filename <- paste0(df$PROTOCOL_ID[i], " - ", df$FILE_NAME[i]) # 写入二进制文件 writeBin(listraws[[i]], con = target_filename) }
tidyverse风格方案
使用purrr包函数,代码更简洁:
library(purrr) # 同时遍历元数据和二进制文件列表,批量保存 pwalk( .l = list( protocol_id = df$PROTOCOL_ID, file_name = df$FILE_NAME, raw_data = listraws ), .f = function(protocol_id, file_name, raw_data) { target_filename <- paste0(protocol_id, " - ", file_name) writeBin(raw_data, con = target_filename) } )
注意事项
- 必须确保
listraws的元素顺序与df的行顺序完全对应,否则会出现文件与文件名不匹配的错误 - 如果需要指定保存到特定文件夹,可在拼接文件名时添加路径,例如:
# 先创建目标文件夹(不存在时自动创建) dir.create("downloaded_files", recursive = TRUE, showWarnings = FALSE) # 拼接带路径的文件名 target_filename <- paste0("downloaded_files/", df$PROTOCOL_ID[i], " - ", df$FILE_NAME[i])
内容的提问来源于stack exchange,提问作者Joe Crozier
相关产品推荐
相关产品推荐

