You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用amazon-textract-response-parser解析S3多页输出报错求助

解决Amazon Textract Response Parser (TRP) 解析S3异步输出时的Block ID缺失错误

问题原因分析

  • TRP要求传入的是单个或多个完整的Textract响应对象数组,当前代码错误地将每个S3输出文件解析为ApiAsyncJobOuputSucceded[]类型(数组),但实际上每个S3文件本身就是一个单独的ApiAsyncJobOuputSucceded对象(包含该分页的所有Blocks、元数据等)。
  • 这种结构错误导致TRP在解析时无法正确关联Block之间的引用关系,从而抛出"Missing parser item for block ID"错误。

关键结论

  1. Block ID一致性无需额外参数:Textract异步任务生成的S3输出中,Block ID是全局唯一且一致的,不存在参数遗漏导致的ID不一致问题。
  2. 实例化TextractDocument无需特殊配置:只需确保传入的是格式正确的响应对象数组即可。
  3. 不必依赖GetDocumentAnalysis的原始响应:S3输出文件和GetDocumentAnalysis分页返回的结构完全一致,只要正确收集格式就能被TRP解析。

修正后的代码示例

修改loadAllOutputFilesIntoTextractDocument函数,正确收集S3输出文件的响应对象:

function loadAllOutputFilesIntoTextractDocument({
  outputDir,
}: { outputDir: string; }) {
  // 读取目录下所有JSON文件,过滤掉无关文件
  const collectedResponses = readdirSync(outputDir)
    .filter(filePath => filePath.endsWith('.json') && !filePath.includes('.s3_access_check'))
    .map(filePath => 
      JSON.parse(readFileSync(`${outputDir}/${filePath}`, { encoding: "utf-8" })) as ApiAsyncJobOuputSucceded
    );

  // 将响应对象数组传入TextractDocument
  return new TextractDocument(collectedResponses as unknown as ApiResponsePage[]);
}

额外说明

  • S3中每个输出文件对应一次GetDocumentAnalysisCommand分页请求的返回结果,因此直接将所有文件的内容收集为数组传入TRP即可,TRP会自动合并处理所有分页的Blocks。
  • 如果仍有问题,可检查S3下载的文件是否完整,确保没有遗漏任何分页输出文件(除了.s3_access_check这类校验文件)。

内容的提问来源于stack exchange,提问作者glimmbo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 09:44:50