使用amazon-textract-response-parser解析S3多页输出报错求助
解决Amazon Textract Response Parser (TRP) 解析S3异步输出时的Block ID缺失错误
问题原因分析
- TRP要求传入的是单个或多个完整的Textract响应对象数组,当前代码错误地将每个S3输出文件解析为
ApiAsyncJobOuputSucceded[]类型(数组),但实际上每个S3文件本身就是一个单独的ApiAsyncJobOuputSucceded对象(包含该分页的所有Blocks、元数据等)。 - 这种结构错误导致TRP在解析时无法正确关联Block之间的引用关系,从而抛出"Missing parser item for block ID"错误。
关键结论
- Block ID一致性无需额外参数:Textract异步任务生成的S3输出中,Block ID是全局唯一且一致的,不存在参数遗漏导致的ID不一致问题。
- 实例化TextractDocument无需特殊配置:只需确保传入的是格式正确的响应对象数组即可。
- 不必依赖GetDocumentAnalysis的原始响应:S3输出文件和GetDocumentAnalysis分页返回的结构完全一致,只要正确收集格式就能被TRP解析。
修正后的代码示例
修改loadAllOutputFilesIntoTextractDocument函数,正确收集S3输出文件的响应对象:
function loadAllOutputFilesIntoTextractDocument({ outputDir, }: { outputDir: string; }) { // 读取目录下所有JSON文件,过滤掉无关文件 const collectedResponses = readdirSync(outputDir) .filter(filePath => filePath.endsWith('.json') && !filePath.includes('.s3_access_check')) .map(filePath => JSON.parse(readFileSync(`${outputDir}/${filePath}`, { encoding: "utf-8" })) as ApiAsyncJobOuputSucceded ); // 将响应对象数组传入TextractDocument return new TextractDocument(collectedResponses as unknown as ApiResponsePage[]); }
额外说明
- S3中每个输出文件对应一次
GetDocumentAnalysisCommand分页请求的返回结果,因此直接将所有文件的内容收集为数组传入TRP即可,TRP会自动合并处理所有分页的Blocks。 - 如果仍有问题,可检查S3下载的文件是否完整,确保没有遗漏任何分页输出文件(除了
.s3_access_check这类校验文件)。
内容的提问来源于stack exchange,提问作者glimmbo
相关产品推荐
相关产品推荐

