如何获取Tesseract OSD输出脚本列表以匹配lang参数?
Tesseract OSD脚本输出列表获取与Han映射解决办法
获取OSD脚本输出列表的方法
- 查看源码定义:OSD返回的脚本类型对应Tesseract源码中的
ScriptCodes枚举,在tesseract/src/ccstruct/publictypes.h文件里,所有OSD可识别的脚本标识(比如Han、Latin、Arabic等)都有明确列出。 - 实操收集结果:准备不同脚本的测试图片,执行OSD命令
tesseract 测试图路径 stdout --psm 0,收集每次返回的脚本结果,逐步积累出完整的输出列表。
Han脚本的映射处理
OSD返回的Han是中文脚本的统称,而Tesseract OCR要求传入具体的简体/繁体及排版方向参数(HanS、HanS_Vert、HanT、HanT_Vert),可以按以下方式处理:
- 先通过OSD识别文本的排版方向(横排/竖排),再补充简单的字符检测逻辑(比如统计简体特有高频字判断为简体,反之则为繁体),将
Han映射到对应的合法lang参数。 - 如果不需要严格区分简繁体,直接把
Han映射为chi_sim(对应HanS)或chi_tra(对应HanT)即可,这两个是Tesseract常用的中文语言包别名,与官方的HanS/HanT参数完全等效。
内容的提问来源于stack exchange,提问作者webb
相关产品推荐
相关产品推荐

