Datacap是否支持读取可搜索PDF而非使用OCR?
Datacap读取可搜索PDF的非OCR方案
Datacap完全支持直接提取可搜索PDF的原生文本,无需经过OCR流程,核心依赖专门的PDF文本提取类Actions,以下是具体方案:
ReadPDFTextAction:这是最常用的原生PDF文本提取工具,可直接解析PDF中的文本流,将提取内容存入页面或字段级变量。只需在规则集中调用该Action,指定文本输出的存储位置即可,全程不触发OCR引擎。ExtractTextFromPDFAction:部分Datacap版本提供该Action,功能与ReadPDFText类似,专注于高效提取可搜索PDF的文本内容,适合批量处理场景。- 配套规则配置:
- 可先用
IsPDFSearchableAction验证文档是否为可搜索类型,避免无效流程 - 务必跳过OCR相关规则分支,比如不要调用
RecognizePage这类依赖OCR识别的Action - 提取文本后,可复用
LocateText、PatternMatch等文本分析Action定位具体字段,逻辑和处理OCR结果一致,只是数据源替换为PDF原生文本
- 可先用
注意事项
- 若PDF存在加密或权限限制,需先通过
DecryptPDFAction解锁,否则无法正常提取文本 - 对于包含嵌入式字体但文本可选中的PDF,上述Actions依然有效,因为它们读取的是PDF底层的文本流,而非依赖图像识别
内容的提问来源于stack exchange,提问作者user3067752
相关产品推荐
相关产品推荐

