AWS Comprehend自定义实体识别报DOCUMENT_CORPUS_SIZE_LESS_THEN_MINIMUM错误
AWS Comprehend 自定义实体识别报错DOCUMENT_CORPUS_SIZE_LESS_THEN_MINIMUM原因说明
核心校验逻辑说明
你遇到的DOCUMENT_CORPUS_SIZE_LESS_THEN_MINIMUM报错,校验的是用于训练/测试的原始文本语料的总有效大小,和你上传的实体标注CSV文件大小无关。你提到的7KB是实体标注文件的体积,不属于该报错的校验范围。
常见触发原因
- 原始训练语料总大小不足:你用来标注实体的原始文本文件(TXT、PDF等格式的源文档集合)总大小小于5120字节,即便标注文件体积达标也会触发校验失败
- 有效语料占比过低:如果原始训练文档中存在大量空白字符、无意义空行,AWS计算有效语料大小时会自动剔除这部分内容,最终统计的有效字节数低于阈值
- 标注与源文件映射异常:实体标注CSV中记录的源文档路径错误、关联的源文档缺失,导致Comprehend实际能读取到的有效训练语料不足
- 测试集语料不达标:自定义实体识别对测试集的原始语料同样有最小5120字节的要求,你当前测试数据对应的原始语料大概率也未达到该阈值
修复方案
- 统计所有训练、测试用原始文本文件的总大小,确保纯文本有效内容总容量≥5120字节
- 清理原始语料中的无效空白内容,避免有效字节数被冗余内容压缩
- 核对标注CSV中的源文档路径、实体对应关系,确保所有标注条目都能匹配到完整的原始文档
内容的提问来源于stack exchange,提问作者MNSH
相关产品推荐
相关产品推荐

