Microsoft Azure手写检测API边界框8个参数含义咨询
理解Azure认知服务手写识别API的
boundingBox参数 我之前在使用Azure认知服务的手写识别API时也遇到过同样的困惑,官方文档里确实没把这个细节讲得很直白,现在给你拆解清楚:
这个boundingBox数组里的8个数值,本质是四个顶点的坐标对,按顺时针顺序依次对应文本区域的四个角:
- 第1、2位数值:
[2, 52]→ 文本区域的左上角(x坐标,y坐标) - 第3、4位数值:
[65, 46]→ 文本区域的右上角 - 第5、6位数值:
[69, 89]→ 文本区域的右下角 - 第7、8位数值:
[7, 95]→ 文本区域的左下角
额外说明
- 坐标系统的原点是图片的左上角,x轴向右递增,y轴向下递增,单位为像素。
- 这种四边形边界框是为了适配手写文本可能存在的倾斜、变形情况,比普通的轴对齐矩形更精准地框住不规则的手写内容。
举你提供的示例来看:[2, 52, 65, 46, 69, 89, 7, 95]对应的就是一个轻微倾斜的四边形,刚好贴合手写的"dog"文本区域。
内容的提问来源于stack exchange,提问作者Rohan Pillai
相关产品推荐
相关产品推荐

