You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

能否下载Power Automate AI Builder训练的模型?求跨平台部署工具推荐

问题概述

需要从数千份不同布局的PDF中提取地点、地址、设备型号等特定信息,目标是将模型集成到Python中,未来嵌入网站或其他应用。目前已通过Power Automate AI Builder完成数百份PDF的标注和模型训练,但该模型无法下载,也不能部署到微软生态之外的环境。

主流平台能力说明
  • Google Document AI:支持自定义文档提取模型的标注与训练,但不能直接下载模型文件,只能通过其Python SDK调用云端服务实现集成,模型始终托管在Google云平台,无法离线部署。
  • Azure AI Document Intelligence(原Form Recognizer):自定义训练后的模型同样不支持导出本地文件,只能通过REST API或Python SDK调用云端服务。仅部分预训练模型支持容器化离线部署,自定义模型暂不支持。
支持模型下载的工具推荐
  • spaCy + Prodigy:Prodigy可可视化标注PDF转换后的文本/布局数据,训练自定义命名实体识别(NER)模型,训练完成后能导出spaCy格式的模型文件,可直接在Python中离线加载使用。需要先借助PyMuPDF、pdfplumber等工具将PDF转为带布局信息的文本格式。
  • 自定义PyTorch/TensorFlow模型:如果具备开发能力,可先用PyMuPDF提取PDF的文本和布局信息,通过LabelStudio完成数据标注,再用PyTorch或TensorFlow训练专属的信息抽取模型,训练后可导出.pt/.h5等格式的本地模型文件,完全可控,支持离线集成到Python项目或应用中。
  • LayoutLM系列模型:微软开源的LayoutLM专门针对文档布局信息抽取,可通过Hugging Face Transformers库加载预训练模型,用自己标注的PDF数据微调,微调后的模型可导出为本地文件,直接在Python中使用,也能部署到网站或应用。
实用提示
  • 之前在Power Automate AI Builder中完成的标注数据,可导出为JSON等通用格式,导入到新工具中复用,减少重复标注工作。
  • 选择开源工具时,PDF的布局解析(文本位置、字体信息提取)是核心步骤,这直接影响模型对不同布局PDF的适配能力。

内容的提问来源于stack exchange,提问作者Wassim Chihi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.19 01:55:02