关于Google Vision API DOCUMENT_TEXT_DETECTION日文旧体字识别错误的问询
Google Vision API OCR(DOCUMENT_TEXT_DETECTION)日文旧体字识别异常问题
我们正在使用Google Vision API的OCR服务(DOCUMENT_TEXT_DETECTION),自2024年3月8日上午9点左右(日本标准时间,JST)起,发现部分日文(JA)文本被错误识别为日文旧体字。
例如,字符「内」(读音nai)被识别为旧体形式「內」(读音nai)。该问题并非所有场景都会出现旧体字,有时也会返回标准日文字符。此问题此前从未发生过,且2024年3月8日后被识别出旧体字的文档,后续再次识别时会返回新旧字符混合的结果。
我们已检查响应区域设置,最初以为仅影响und区域设置,但确认ja区域设置同样存在该问题。
请问:
- 近期是否对内部算法进行了变更?
- 若有解决该问题的方案,请告知。
感谢协助。
附加信息
- 语言:日文(JA)
- 操作系统:Windows
- 接口地址(ENDPOINT):
https://vision.googleapis.com/v1/images:annotate - 开发工具包(SDK):REST
可复现请求体
{ "requests": [ { "image": { "source": { "imageUri": "CLOUD_STORAGE_IMAGE_URI" } }, "features": [ { "type": "DOCUMENT_TEXT_DETECTION" } ] } ] }
预期输出
内閣府
实际输出
內閣府
内容的提问来源于stack exchange,提问作者OyaDuck
相关产品推荐
相关产品推荐

