You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

寻求AI训练用OCR生成.md文件的全自动化清理方案(解决LLM幻觉问题)

OCR生成MD文件全自动化清理的幻觉问题解决方案

核心问题定位

当前场景为处理书籍OCR生成的AI训练用MD文件,已完成70%自动化清理,剩余30%尝试通过LangChain+RAG+LLM实现全自动化修复时,虽能解决结构混乱、内容破损问题,但存在严重幻觉,输出内容偏离原始OCR文本。

针对性解决方案

1. 强化RAG精准检索约束

  • 构建OCR原始文本专属向量库,仅导入待清理MD文件的原始内容,杜绝外部无关语料干扰
  • 调整检索策略:采用mmr检索模式替代默认相似性检索,控制返回上下文片段数量(建议3-5条),确保LLM仅基于最相关的原始内容生成修复结果
  • 为检索结果添加来源标识,明确要求LLM所有修复动作必须基于给定原始片段,禁止生成外部内容

2. 优化LLM提示词边界规则

  • 编写严格指令,明确LLM修复范围:
    • 仅修复格式错误、补全破损内容,不得添加原始文本不存在的信息
    • 原始内容存在歧义时,保留原始内容并标注[待人工校验],禁止自行猜测补全
    • 输出必须严格匹配原始文本核心语义,仅调整MD格式结构
  • 示例提示词框架:
你是MD文件格式修复专家,仅能基于提供的原始OCR文本片段操作:
1. 修复混乱的MD结构(标题层级、列表格式、段落分隔等)
2. 补全破损内容,但必须严格遵循原始语义,不得添加额外信息
3. 无法确定的破损内容标注[待人工校验]
4. 输出仅含修复后的MD内容,无其他说明

原始文本片段:
{检索到的上下文}

3. 增加幻觉校验环节

  • 在LLM修复后添加语义一致性校验步骤:
    • 用轻量级模型(如BERT-base)计算修复后文本与原始OCR文本的语义相似度,设置0.9的阈值,低于阈值的内容标记为疑似幻觉
    • 对疑似幻觉内容做关键词匹配校验,确保核心关键词与原始文本完全一致
  • 校验不通过的内容自动转入人工处理队列,避免幻觉内容流入训练数据集

4. 分场景定制修复逻辑

  • 将剩余30%人工处理内容分类(格式混乱、内容破损、语义歧义),针对不同场景搭建专属修复链:
    • 格式混乱场景:仅用规则引擎+LangChain格式处理工具,无需调用LLM,从根源避免幻觉
    • 内容破损场景:结合RAG检索的原始片段+LLM补全能力,严格约束补全范围
    • 语义歧义场景:直接标记为待人工校验,不强制LLM补全

内容的提问来源于stack exchange,提问作者Sad Person

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.01 14:34:51