You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Datacap是否支持读取可搜索PDF而非使用OCR?

Datacap读取可搜索PDF的非OCR方案

Datacap完全支持直接提取可搜索PDF的原生文本,无需经过OCR流程,核心依赖专门的PDF文本提取类Actions,以下是具体方案:

  • ReadPDFText Action:这是最常用的原生PDF文本提取工具,可直接解析PDF中的文本流,将提取内容存入页面或字段级变量。只需在规则集中调用该Action,指定文本输出的存储位置即可,全程不触发OCR引擎。
  • ExtractTextFromPDF Action:部分Datacap版本提供该Action,功能与ReadPDFText类似,专注于高效提取可搜索PDF的文本内容,适合批量处理场景。
  • 配套规则配置:
    • 可先用IsPDFSearchable Action验证文档是否为可搜索类型,避免无效流程
    • 务必跳过OCR相关规则分支,比如不要调用RecognizePage这类依赖OCR识别的Action
    • 提取文本后,可复用LocateText、PatternMatch等文本分析Action定位具体字段,逻辑和处理OCR结果一致,只是数据源替换为PDF原生文本

注意事项

  • 若PDF存在加密或权限限制,需先通过DecryptPDF Action解锁,否则无法正常提取文本
  • 对于包含嵌入式字体但文本可选中的PDF,上述Actions依然有效,因为它们读取的是PDF底层的文本流,而非依赖图像识别

内容的提问来源于stack exchange,提问作者user3067752

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 15:32:38