PDF Management VBO文本提取异常:数据项有字符数却无内容
问题描述
使用Blue Prism的PDF Management VBO提取PDF文本,通过操作阶段将提取结果保存至数据项。运行RPA时显示提取成功(数据项显示包含2000字符),但打开数据项却无实际文本内容。该PDF可正常读取和复制,对应的“PDF Management - Extract All Text”代码阶段代码如下:
Success = true; ErrorMessage = "No Error"; OutputText = string.Empty; try { Extract_Text et = new Extract_Text(); OutputText = et.Extract_All_Text(PDFFilePath); } catch (Exception ex) { Success = false; ErrorMessage = ex.Message; }
可能原因分析
- 提取的文本全为不可见字符:PDF中可能存在大量空白符、换行符、制表符或Unicode控制字符,这些字符会被计入字符数,但在Blue Prism数据项预览中无法直观显示。可在代码阶段添加
OutputText = OutputText.Trim()或用正则表达式清除不可见字符后验证结果。 - Blue Prism数据项预览限制:部分Blue Prism版本对数据项预览的显示长度、内容类型有约束,即使数据项实际存有内容,预览窗口也无法完整展示。可通过添加“写入文件”阶段,将
OutputText保存为TXT文件查看实际内容。 - VBO方法返回的文本编码不兼容:
Extract_All_Text方法可能返回了带有特殊编码的文本,Blue Prism数据项的预览解析逻辑无法识别这类编码,导致显示为空。可尝试在代码中进行编码转换,比如OutputText = System.Text.Encoding.UTF8.GetString(System.Text.Encoding.Default.GetBytes(OutputText))。 - 数据项映射逻辑错误:检查操作阶段中数据项的赋值映射是否正确,是否存在将
OutputText误赋值给空数据项,或类型转换过程中未被捕获的内容丢失情况。 - PDF内部文本存储结构异常:虽然PDF可手动复制,但内部文本可能以非连续块、反向顺序或特殊结构存储,VBO提取拼接后内容在预览中无法正常显示,但字符数仍被统计。可尝试调用VBO的“Extract Page Text”方法逐页提取,验证单页内容是否正常。
内容的提问来源于stack exchange,提问作者marvelfab12
相关产品推荐
相关产品推荐

