能否通过指定区域位置调用Textract API提取特定字段文本?
关于AWS Textract指定提取区域获取特定字段的解决方案
- 完全可以通过指定位置区域精准提取目标字段,AWS Textract支持基于**边界框(BoundingBox)**的区域筛选,适配你提供的这类相对位置参数(Left/Top/Width/Height均为相对于文档整体宽高的比例值)。
- 具体实现步骤:
- 调用
AnalyzeDocument接口获取全量文本块后,用你提供的位置参数作为目标区域,筛选匹配的文本块:- 先将给出的参数封装为标准BoundingBox结构:
{ "Width": 0.03215303644537926, "Height": 0.005642734467983246, "Left": 0.05062320828437805, "Top": 0.7153081297874451 }
- 先将给出的参数封装为标准BoundingBox结构:
- 遍历接口返回的所有
Block对象,对比每个Block的BoundingBox与目标区域的重叠度(可通过计算IOU交并比判断),提取落在目标区域内的Block对应的Text字段即可。
- 调用
- 优势:由于参数是相对比例值,只要文档格式布局一致,即使尺寸不同也能复用这套参数,刚好适配你批量处理同格式文档的场景。
内容的提问来源于stack exchange,提问作者JCS
相关产品推荐
相关产品推荐

