You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python正则表达式提取PDF中同模式的列数据

按列提取数据的解决方案

方法一:直接文本拆分(最简洁高效)

不需要复杂正则,通过文本拆分+转置即可实现:

  • 把输入文本按换行符分割成各行
  • 每行按空白字符分割成单独元素(自动处理多空格)
  • 用zip()函数转置行和列,再转成元组列表

代码示例:

text = """2000 2001 2002 2003
14,756 10,922 9,745 12,861
9,882 11,568 8,176 10,483
13,925 10,724 10,032 8,927"""

# 拆分每行并提取元素
rows = [line.split() for line in text.splitlines() if line.strip()]
# 转置行列为列数据,转成元组列表
result = list(zip(*rows))

print(result)

输出结果:

[('2000', '14,756', '9,882', '13,925'),
 ('2001', '10,922', '11,568', '10,724'),
 ('2002', '9,745', '8,176', '10,032'),
 ('2003', '12,861', '10,483', '8,927')]

方法二:正则匹配(适配PDF抓取场景)

如果需要在PDF抓取阶段用正则定位元素,可针对年份和数字格式写匹配规则:

import re

text = """2000 2001 2002 2003
14,756 10,922 9,745 12,861
9,882 11,568 8,176 10,483
13,925 10,724 10,032 8,927"""

# 匹配4位年份或带千分符的数字
pattern = re.compile(r'\d{4}|\d{1,3}(?:,\d{3})?')
# 提取每行的所有匹配项
rows = [pattern.findall(line) for line in text.splitlines() if line.strip()]
# 转置得到列数据
result = list(zip(*rows))

print(result)

核心逻辑是先把每行的元素单独提取,再通过zip(*rows)完成行列转置,这比强行用正则定位列位置更易维护。

内容的提问来源于stack exchange,提问作者sadie_b

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 04:30:49