如何将PDF提取的单列DataFrame拆分并补全缺失值为NA?
解决PDF提取数据拆分问题
核心问题分析
直接按空格拆分的缺陷:
- 金额中的千位空格会被误拆分,导致金额字段断裂
- 金额与$符号分离成两列
- 缺失的字段(如第一行的C列)无法自动填充NA,只会导致后续列移位
解决方案:使用正则匹配完整字段
利用tidyr::separate_wider_regex()函数,通过正则表达式精准匹配每个字段的格式,同时处理可选字段的NA填充。
代码实现
library(tidyverse) # 执行拆分,通过正则匹配每个完整字段 my_data_clean <- my_data %>% separate_wider_regex( col = stuff, patterns = list( A = "(\\d{4})", B = "(Q-\\d)", C = "(r\\.\\d+)?", # 可选字段,无匹配则自动填充NA D = "(\\d{16})", E = "(\\d{3})", F = "(\\d{4}-\\d{2}-\\d{2})", G = "([\\d\\s]+,\\d{2}\\s+\\$)", H = "([\\d\\s]+,\\d{2}\\s+\\$)", I = "([\\d\\s]+,\\d{2}\\s+\\$)", K = "([\\d\\s]+,\\d{2}\\s+\\$)?", # 可选字段,无匹配则自动填充NA L = "([\\d\\s]+,\\d{2}\\s+\\$)" ), sep = "\\s+" # 字段间用一个或多个空格分隔 )
匹配规则说明
A:匹配4位年份数字(如2012)B:匹配季度标识(如Q-2)C:可选的r.XX格式字段,无匹配时自动填充NAD:匹配16位长数字串(如1004001115648091)E:匹配3位数字(如001)F:匹配YYYY-MM-DD格式日期G/H/I/K/L:匹配完整金额字段,包含千位空格、逗号小数和$符号(如10 000,00 $),其中C和K为可选字段,无匹配则填充NA
验证结果
拆分后将得到11列数据,完全符合预期格式:
- 第一行的
C列填充NA - 第二行的
K列填充NA - 所有金额字段保持完整,未被拆分
内容的提问来源于stack exchange,提问作者F-x Duhamel
相关产品推荐
相关产品推荐

