关于AWS Textract异步操作:外部存储文档能否传入字节数组?
AWS Textract StartDocumentTextDetection 相关疑问解答
StartDocumentTextDetection是否要求文档必须存储在AWS S3?
是的,这个异步处理API必须依赖AWS S3存储桶来存放文档。因为多页PDF的异步处理需要Textract能够持续访问文档资源完成全流程解析,所以调用该方法时只能通过指定S3Object参数(即S3桶路径)来传入文档。外部文档的字节数组能否传入Textract操作?
直接传入字节数组的方式仅支持Textract的同步API(比如AnalyzeDocument),但同步API有单文档最大10MB的限制,且不适合多页PDF的异步批量处理场景。
如果你的文档存放在非AWS外部存储,可参考两种解决方案:
- 先将外部文档上传至AWS S3存储桶,再调用
StartDocumentTextDetection并指定对应的S3对象路径 - 若文档体积较小(≤10MB),可使用同步
AnalyzeDocumentAPI,通过Bytes参数直接传入文档字节数组,但此方法仅适用于短文档的快速解析
内容的提问来源于stack exchange,提问作者user1597990
相关产品推荐
相关产品推荐

