You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将PDF提取的单列DataFrame拆分并补全缺失值为NA?

解决PDF提取数据拆分问题

核心问题分析

直接按空格拆分的缺陷:

  • 金额中的千位空格会被误拆分,导致金额字段断裂
  • 金额与$符号分离成两列
  • 缺失的字段(如第一行的C列)无法自动填充NA,只会导致后续列移位

解决方案:使用正则匹配完整字段

利用tidyr::separate_wider_regex()函数,通过正则表达式精准匹配每个字段的格式,同时处理可选字段的NA填充。

代码实现

library(tidyverse)

# 执行拆分,通过正则匹配每个完整字段
my_data_clean <- my_data %>%
  separate_wider_regex(
    col = stuff,
    patterns = list(
      A = "(\\d{4})",
      B = "(Q-\\d)",
      C = "(r\\.\\d+)?",  # 可选字段,无匹配则自动填充NA
      D = "(\\d{16})",
      E = "(\\d{3})",
      F = "(\\d{4}-\\d{2}-\\d{2})",
      G = "([\\d\\s]+,\\d{2}\\s+\\$)",
      H = "([\\d\\s]+,\\d{2}\\s+\\$)",
      I = "([\\d\\s]+,\\d{2}\\s+\\$)",
      K = "([\\d\\s]+,\\d{2}\\s+\\$)?",  # 可选字段,无匹配则自动填充NA
      L = "([\\d\\s]+,\\d{2}\\s+\\$)"
    ),
    sep = "\\s+"  # 字段间用一个或多个空格分隔
  )

匹配规则说明

  • A:匹配4位年份数字(如2012)
  • B:匹配季度标识(如Q-2)
  • C:可选的r.XX格式字段,无匹配时自动填充NA
  • D:匹配16位长数字串(如1004001115648091)
  • E:匹配3位数字(如001)
  • F:匹配YYYY-MM-DD格式日期
  • G/H/I/K/L:匹配完整金额字段,包含千位空格、逗号小数和$符号(如10 000,00 $),其中C和K为可选字段,无匹配则填充NA

验证结果

拆分后将得到11列数据,完全符合预期格式:

  • 第一行的C列填充NA
  • 第二行的K列填充NA
  • 所有金额字段保持完整,未被拆分

内容的提问来源于stack exchange,提问作者F-x Duhamel

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.07 15:45:52