You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Microsoft Azure手写检测API边界框8个参数含义咨询

理解Azure认知服务手写识别API的boundingBox参数

我之前在使用Azure认知服务的手写识别API时也遇到过同样的困惑,官方文档里确实没把这个细节讲得很直白,现在给你拆解清楚:

这个boundingBox数组里的8个数值,本质是四个顶点的坐标对,按顺时针顺序依次对应文本区域的四个角:

  • 第1、2位数值:[2, 52] → 文本区域的左上角(x坐标,y坐标)
  • 第3、4位数值:[65, 46] → 文本区域的右上角
  • 第5、6位数值:[69, 89] → 文本区域的右下角
  • 第7、8位数值:[7, 95] → 文本区域的左下角

额外说明

  • 坐标系统的原点是图片的左上角,x轴向右递增,y轴向下递增,单位为像素。
  • 这种四边形边界框是为了适配手写文本可能存在的倾斜、变形情况,比普通的轴对齐矩形更精准地框住不规则的手写内容。

举你提供的示例来看:[2, 52, 65, 46, 69, 89, 7, 95]对应的就是一个轻微倾斜的四边形,刚好贴合手写的"dog"文本区域。

内容的提问来源于stack exchange,提问作者Rohan Pillai

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.29 07:44:20