PDFX服务无法访问 咨询学术PDF转结构化XML的替代方案
PDFX服务可用性及学术文档结构重构替代方案说明
原PDFX公开服务状态
曼彻斯特大学维护的PDFX公开接口http://pdfx.cs.man.ac.uk/已正式下线,目前不再对外提供公开访问服务。如果此前你已经部署过PDFX的开源本地版本,仍可以在本地环境正常使用对应功能。
可替代的学术文档结构重构方案
- GROBID:基于机器学习的学术文档专用解析工具,支持将PDF转换为结构化XML或JSON格式,可精准识别标题、章节层级、图表、参考文献、作者及所属机构等多维度逻辑结构,支持本地部署,也有封装完成的Python开发套件可直接调用,整体解析准确率优于传统规则驱动类工具。
- CERMINE:专门面向学术出版物的内容抽取工具,支持批量处理PDF格式论文,输出包含完整逻辑结构的结构化文档,支持本地部署和接口调用,对小语种、非标准排版的学术文献适配性更强。
- PyPDF2+自定义规则组合:如果你的需求场景比较简单,仅需要抽取章节标题、正文等基础结构,可通过PyPDF2读取PDF文本内容后,结合字体大小、段落间距等排版特征自定义识别规则,无需依赖第三方在线服务,灵活度更高。
- 自定义标注训练方案:如果有特定领域的大量学术文档处理需求,可先通过标注工具完成自有文档的结构标注,训练适配业务场景的自定义信息抽取模型,满足特殊格式的结构解析要求。
如果你需要和原PDFX调用逻辑一致的替代方案,本地部署GROBID后可使用如下Python代码完成调用:
import requests # 本地部署GROBID后默认接口地址 url = "http://localhost:8070/api/processFulltextDocument" files = {"input": open("待处理论文路径.pdf", "rb")} response = requests.post(url, files=files) # 结构化结果可通过response.text获取
内容的提问来源于stack exchange,提问作者Ignasi
相关产品推荐
相关产品推荐

