You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PDF Management VBO文本提取异常:数据项有字符数却无内容

问题描述

使用Blue Prism的PDF Management VBO提取PDF文本,通过操作阶段将提取结果保存至数据项。运行RPA时显示提取成功(数据项显示包含2000字符),但打开数据项却无实际文本内容。该PDF可正常读取和复制,对应的“PDF Management - Extract All Text”代码阶段代码如下:

Success = true;
ErrorMessage = "No Error";
OutputText = string.Empty;
try
{
    Extract_Text et = new Extract_Text();
    OutputText = et.Extract_All_Text(PDFFilePath);
}
catch (Exception ex)
{
    Success = false;
    ErrorMessage = ex.Message;
}
可能原因分析
  • 提取的文本全为不可见字符:PDF中可能存在大量空白符、换行符、制表符或Unicode控制字符,这些字符会被计入字符数,但在Blue Prism数据项预览中无法直观显示。可在代码阶段添加OutputText = OutputText.Trim()或用正则表达式清除不可见字符后验证结果。
  • Blue Prism数据项预览限制:部分Blue Prism版本对数据项预览的显示长度、内容类型有约束,即使数据项实际存有内容,预览窗口也无法完整展示。可通过添加“写入文件”阶段,将OutputText保存为TXT文件查看实际内容。
  • VBO方法返回的文本编码不兼容:Extract_All_Text方法可能返回了带有特殊编码的文本,Blue Prism数据项的预览解析逻辑无法识别这类编码,导致显示为空。可尝试在代码中进行编码转换,比如OutputText = System.Text.Encoding.UTF8.GetString(System.Text.Encoding.Default.GetBytes(OutputText))。
  • 数据项映射逻辑错误:检查操作阶段中数据项的赋值映射是否正确,是否存在将OutputText误赋值给空数据项,或类型转换过程中未被捕获的内容丢失情况。
  • PDF内部文本存储结构异常:虽然PDF可手动复制,但内部文本可能以非连续块、反向顺序或特殊结构存储,VBO提取拼接后内容在预览中无法正常显示,但字符数仍被统计。可尝试调用VBO的“Extract Page Text”方法逐页提取,验证单页内容是否正常。

内容的提问来源于stack exchange,提问作者marvelfab12

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.18 22:03:10