You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Power Query合并格式略有差异的PDF文件

问题说明
  • 需提取若干PDF中红色标注的值,整理为指定格式的表格(样式参考下方示例图)
  • 现有3份PDF样本,存在的问题:部分PDF的表格之间有空格,需将未在表格内的DATE(日期)单独列出来
  • 咨询:能否通过Power Query将这3份样本PDF合并为单个文件?

表格样式示例图

实现方案(Power Query)

完全可以用Power Query完成需求,核心步骤如下:

1. 批量导入PDF文件

  • 打开Excel,切换到「数据」选项卡,选择「获取数据」>「从文件」>「从文件夹」,选中存放3份PDF的文件夹
  • 在弹出的窗口中点击「编辑」,进入Power Query编辑器

2. 提取内容并处理独立日期

  • 添加自定义列,用Table.PromoteHeaders(Pdf.Tables([Content]))提取每个PDF的表格数据;对于表格外的DATE,可通过Text.PositionOf、Text.Middle等函数定位PDF文本中的日期位置(需根据PDF的文本结构调整具体逻辑),提取后作为单独列添加
  • 筛选出带红色标注的行:如果PDF里的红色标注在文本提取时带有格式标记,可结合Pdf.Extract函数提取带格式的文本,再通过格式特征筛选目标行

3. 合并与整理表格

  • 统一各提取表格的字段名,删除冗余列,保证结构一致
  • 追加所有表格数据,调整为指定的表格样式后,加载回Excel即可

注:如果3份PDF的文本结构差异较大,可能需要针对不同文件编写条件判断,适配表格外日期的不同位置。

内容的提问来源于stack exchange,提问作者chi005

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.28 09:05:03