You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在AWS Comprehend中获取或训练识别文档类别

文档分类实现方案及AWS Comprehend自定义分类训练指南

可行落地方案总览

你提到的宣传册、目录、证书、简历等类别的文档分类需求,有非常成熟的落地路径:

  • 非AWS技术栈场景下,可以用开源多模态文档分类模型实现,这类模型会同时提取文本内容和版式特征(比如宣传册的大量配图、简历的固定个人信息区块、证书的印章/落款格式特征),比纯文本分类的准确率高30%以上。
  • 纯文本语料场景下,直接基于文本特征做分类即可,上述几个类别文本区分度很高,很容易达到可用的准确率。
  • 如果你已经在使用AWS技术栈,用AWS Comprehend自定义分类器是成本最低的方案,不需要自己维护模型部署、算力调度相关的工作。

AWS Comprehend自定义分类器训练流程

1. 准备标注数据集

  • 首先准备标注样本,单类别至少需要10个标注样本,建议备齐50个以上样本能达到稳定可用的效果,样本量越大分类准确率越高。
  • 数据集支持两种输入格式,二选一即可:
    • 单文件模式:每个文档的文本内容单独存为TXT文件,放在对应类别命名的文件夹下,比如/resume/001.txt、/certificate/002.txt
    • CSV格式:第一列填类别标签,第二列填对应文档的完整文本内容,文件不需要表头
  • 如果你的原始文档是PDF、图片类的扫描件,需要先用AWS Textract做OCR提取文本内容之后再输入到Comprehend,不支持直接上传二进制文件训练

2. 创建并启动训练任务

  • 登录AWS Comprehend控制台,选择「自定义分类」→「创建分类器」
  • 分类器模式选择「原生模式」即可,最多支持1000个类别,完全覆盖你的需求
  • 依次填写训练数据集的S3存储路径、分类结果输出的S3路径,选择具备对应读写权限的IAM角色
  • 如果你有独立标注的测试集,可以单独指定测试集的S3路径,否则Comprehend会自动拆分训练集的20%作为测试集做效果评估
  • 提交任务后等待训练完成,根据数据集大小,训练时长从十几分钟到几小时不等

3. 效果评估与优化

  • 训练完成后控制台会输出完整的评估指标,包括精确率、召回率、F1分数,你可以根据业务要求判断是否达标
  • 如果效果达不到要求,可以补充更多标注样本、修正标注错误的样本后重新训练

4. 部署调用

  • 效果达标后可以部署为实时端点,用API实时调用分类,参考调用代码:
import boto3

comprehend_client = boto3.client('comprehend')
response = comprehend_client.classify_document(
    Text="待分类文档的完整文本内容",
    EndpointArn="你部署的分类器端点ARN"
)
# 取置信度最高的分类结果
top_category = response['Classes'][0]['Name']
confidence = response['Classes'][0]['Score']
  • 如果是批量处理大量文档,不需要部署实时端点,直接提交批量分类任务即可,输入待分类文档的S3路径,分类结果会自动输出到你指定的S3路径。

效果优化建议

  • 如果不同类别文档的版式特征差异非常大,可以在输入文本里补充版式特征标记,比如证书的大标题位置、简历的个人信息区块标记,能大幅提升分类准确率。
  • 建议先拿小批量样本跑通整个流程验证可行性,再逐步扩充样本量优化模型效果。

内容的提问来源于stack exchange,提问作者MNSH

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 05:18:01