You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用正则表达式提取固定结构PDF中两个指定德语标签的内容

正则表达式提取方案

以下正则均适配你提供的PDF文本结构,匹配范围为目标标签后到下一个标准章节标题前的全部内容:

1. 提取Wertmindernde Faktoren下的表格

该标签下内容固定为表格,使用如下正则:
Wertmindernde Faktoren\s*(.*?)(?=\s*(?:Gebrauchsspuren|Vorschaden|Nachlackierungen|Hinweise zum Gutachten|$))

  • 匹配逻辑:定位目标标签后,抓取所有内容直到遇到下一个已知章节标题或文本末尾,刚好覆盖完整表格(含表头和所有数据行)
  • 需开启正则单行模式(DotAll),保证.可以匹配换行符

2. 提取Gebrauchsspuren下的内容(兼容表格/纯文本格式)

该标签下内容格式不固定,使用如下通用正则:
Gebrauchsspuren\s*(.*?)(?=\s*(?:Vorschaden|Nachlackierungen|Hinweise zum Gutachten|$))

  • 匹配逻辑:不限制内容格式,自动识别到下一个章节标题停止,不管是表格还是纯句子都可以完整提取
  • 同样需要开启单行模式(DotAll)

UiPath使用注意事项

  • 在Matches活动配置中,勾选「Singleline」选项即可开启单行模式
  • 匹配成功后,取结果中Groups(1).Value即为所需的目标内容
  • 若需要后续拆分表格的行列,可先按换行符\n拆分得到每一行,再按2个及以上的空格分割得到每一列数据

内容的提问来源于stack exchange,提问作者Dave

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 04:27:00