Windows系统下获取Tesseract古爱尔兰文(seanchló).traineddata文件方法咨询
解决Tesseract识别古爱尔兰文字(seanchló)的.traineddata生成方案
一、基于现有仓库素材生成文件
你提到的仓库虽未直接提供.traineddata,但大概率包含训练所需的样本图(.tif)和标注文件(.box),可通过Tesseract训练工具生成目标文件:
- 安装训练组件:Windows版Tesseract默认可能不含训练工具,需下载带训练模块的安装包,或单独安装
tesseract-ocr-training组件。 - 整理训练素材:将仓库内的样本图与对应标注文件放在同一目录,确保文件名完全匹配(如
sample.tif对应sample.box)。 - 执行训练流程:
- 打开命令提示符,进入素材目录,运行LSTM训练命令:
tesstrain.exe --fonts_dir "C:\Windows\Fonts" --lang gle --linedata_only --noextract_font_properties --training_text your_training_text.txt --trainer_module lstm - 用
combine_tessdata.exe合并训练输出文件,生成gle_uncial.traineddata,将其移至Tesseract的tessdata目录(通常为C:\Program Files\Tesseract-OCR\tessdata)
- 打开命令提示符,进入素材目录,运行LSTM训练命令:
二、针对1910年代文档自制训练集
若现有素材与目标文档风格偏差较大,建议制作专属训练集提升准确率:
- 采集样本:扫描或截取1910年代古爱尔兰文文档的清晰图像,覆盖不同字号、排版及磨损程度的内容。
- 标注样本:借助
jTessBoxEditor工具(需Java环境)打开样本图,手动标注每个字符的位置与对应文字,生成.box标注文件。 - 重复训练步骤:按照上述训练流程,用自制素材生成适配性更强的
.traineddata文件。
三、替代方案:寻找社区预训练模型
可查看Tesseract官方或社区维护的训练数据仓库,寻找标注为uncial/seanchló的古爱尔兰文预训练.traineddata模型,优先选择与1910年代文档字体风格匹配的版本。
内容的提问来源于stack exchange,提问作者RJMB
相关产品推荐
相关产品推荐

