UiPath Studio中提取含空单元格的可变列PDF表格方法咨询
提取PDF中结构不固定且含空单元格的完整表格方案
使用PDFium库结合自定义解析逻辑
用Uipath的Read PDF with PDFium活动提取文本,它能保留表格的布局排版信息,包括空单元格的位置。把提取到的内容按行拆分后,分析每行里连续空格的位置作为列分隔边界,逐行拆分出对应列的单元格,空位置直接留空字符串,就能完整保留空单元格。借助Tabula引擎的自定义配置
在Document Understanding里集成Tabula,开启Detect empty cells选项,针对结构不固定的表格切换到Stream模式——这个模式会根据文本的实际布局识别单元格,哪怕列宽变化,也能精准捕捉到空单元格的位置,不会跳过。自定义OCR后处理逻辑(针对扫描件PDF)
如果是扫描生成的PDF,用Tesseract OCR或Google Cloud Vision提取文本时,同时获取每个文本块的坐标信息。把页面按表格的行、列坐标区域划分,每个区域对应一个单元格,不管区域里有没有内容都生成对应单元格,空区域直接标记为空值。可以用Uipath的Find Text Position活动获取元素坐标,再遍历区域填充表格。用Excel VBA辅助解析
把Read PDF Text的输出粘贴到Excel,写个简单的VBA宏:用固定宽度拆分(TextToColumns)或者循环判断每行的字符位置,按列拆分内容,空单元格的位置直接保留为空,最后导出成规范表格。
内容的提问来源于stack exchange,提问作者Lakshmy
相关产品推荐
相关产品推荐

