You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Label Studio构建适配LayoutLMV1的FUNSD数据集

基于Label Studio构建适配LayoutLMv1的FUNSD格式数据集方案

完全可行,你已经完成的PDF准备、pytesseract OCR识别是整个流程里工作量最大的两个前置环节,剩下的标注配置、导出、后处理步骤按以下流程操作即可,不需要额外开发复杂工具。

Label Studio端标注配置

提前对齐FUNSD的标注规则配置项目,能减少80%的后处理工作量:

  • 新建标注项目后,不要直接导入裸PDF,把pytesseract输出的单页文本块、对应像素级bbox坐标、识别文本内容,按Label Studio预标注格式导入,自动生成预标注框,省去手动拉框的步骤。
  • 标注模板严格匹配FUNSD的标注维度:实体标签只保留4类,分别是question(键/问题字段)、answer(值/答案字段)、header(页眉类文本)、other(其余无关文本);额外添加关系标注项,用来标记question和answer之间的对应关联。
  • 标注过程中注意标注框不要跨多个OCR识别块,保证每个标注框和单个OCR文本块一一对应,避免后续坐标和文本匹配错位。

标注结果导出

所有页面标注完成后,直接选择导出为原始JSON格式即可,不要选择COCO、CSV这类会丢失关系标注信息的格式。

导出JSON转标准FUNSD格式的后处理步骤

FUNSD数据集是单页对应一个标注JSON文件,结构固定,按以下逻辑处理导出的Label Studio JSON即可:

  • 拆分单页样本:Label Studio导出的JSON默认包含所有标注任务,先遍历每个任务项,单个任务对应PDF的一页,单独输出为一个FUNSD标注文件。
  • 坐标格式转换:Label Studio导出的bbox默认是相对于原图的百分比坐标,需要转换为FUNSD要求的像素级绝对坐标,转换逻辑参考:
# img_w、img_h为当前页面对应图片的实际宽高,和OCR识别时用的图片尺寸保持一致
x1 = int(annotation['value']['x'] / 100 * img_w)
y1 = int(annotation['value']['y'] / 100 * img_h)
x2 = int((annotation['value']['x'] + annotation['value']['width']) / 100 * img_w)
y2 = int((annotation['value']['y'] + annotation['value']['height']) / 100 * img_h)
bbox = [x1, y1, x2, y2]

转换完成后和pytesseract原始输出的OCR块坐标做校验,偏差超过2像素的做对齐处理,避免文本和位置不匹配。

  • 实体字段映射:每个标注框对应FUNSD格式中form列表的一个元素,字段按规则填充:
    • id:为每个实体分配从0开始递增的整数唯一标识
    • text:直接取对应OCR块的识别结果,不要手动修改文本内容,和OCR输出保持一致
    • box:填入上一步转换完成的四元组绝对坐标
    • label:直接映射标注时选的4类标签,注意标签名全小写,和FUNSD官方命名保持一致
    • words:将实体文本拆分为单个词单元,如果OCR阶段输出了单词级坐标直接复用,没有的话按文本长度占比切分实体bbox即可,LayoutLMv1对单词级坐标的容错度较高
    • linking:将标注的question-answer关系转换为[源实体id, 目标实体id]的列表,注意FUNSD要求关联双向存储,比如id为1的question关联id为2的answer,需要同时写入[1,2]和[2,1]两个条目
  • 目录结构对齐:处理完所有标注文件后,按FUNSD官方结构存放文件:训练集的标注文件放在training_data/annotations路径下,对应页面图片放在training_data/images路径下;测试集同理放在testing_data的对应子目录下,即可直接适配LayoutLMv1的官方数据加载逻辑,不需要额外修改数据集读取代码。

校验提示:全部处理完成后,随机抽取3-5个样本,把bbox和标签画到对应页面图片上,确认坐标、标签、关联关系都没有错位再开始训练,能避免很多训练阶段的无效问题。

内容的提问来源于stack exchange,提问作者Jyoti yadav

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.01 21:27:37