You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PDFX服务无法访问 咨询学术PDF转结构化XML的替代方案

PDFX服务可用性及学术文档结构重构替代方案说明

原PDFX公开服务状态

曼彻斯特大学维护的PDFX公开接口http://pdfx.cs.man.ac.uk/已正式下线,目前不再对外提供公开访问服务。如果此前你已经部署过PDFX的开源本地版本,仍可以在本地环境正常使用对应功能。

可替代的学术文档结构重构方案

  • GROBID:基于机器学习的学术文档专用解析工具,支持将PDF转换为结构化XML或JSON格式,可精准识别标题、章节层级、图表、参考文献、作者及所属机构等多维度逻辑结构,支持本地部署,也有封装完成的Python开发套件可直接调用,整体解析准确率优于传统规则驱动类工具。
  • CERMINE:专门面向学术出版物的内容抽取工具,支持批量处理PDF格式论文,输出包含完整逻辑结构的结构化文档,支持本地部署和接口调用,对小语种、非标准排版的学术文献适配性更强。
  • PyPDF2+自定义规则组合:如果你的需求场景比较简单,仅需要抽取章节标题、正文等基础结构,可通过PyPDF2读取PDF文本内容后,结合字体大小、段落间距等排版特征自定义识别规则,无需依赖第三方在线服务,灵活度更高。
  • 自定义标注训练方案:如果有特定领域的大量学术文档处理需求,可先通过标注工具完成自有文档的结构标注,训练适配业务场景的自定义信息抽取模型,满足特殊格式的结构解析要求。

如果你需要和原PDFX调用逻辑一致的替代方案,本地部署GROBID后可使用如下Python代码完成调用:

import requests
# 本地部署GROBID后默认接口地址
url = "http://localhost:8070/api/processFulltextDocument"
files = {"input": open("待处理论文路径.pdf", "rb")}
response = requests.post(url, files=files)
# 结构化结果可通过response.text获取

内容的提问来源于stack exchange,提问作者Ignasi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 09:48:03