基于视觉语言模型的系统上下文图数据流精准提取方案咨询
系统上下文图数据流精准提取方案优化
已尝试方法复盘
- 视觉模型提示工程:测试了Phi-3-vision-128k-instruct、llama-3.2-90b-vision-instruct两款模型
- 图表拆分处理:将完整系统上下文图拆分为更小模块,单独提取每个模块的数据流
- OCR+视觉模型组合:先通过OCR识别图表中的文字信息,再将识别结果反馈给视觉模型进行数据流提取
当前核心问题
- 数据流遗漏:部分关键节点间的数据流未被识别
- 虚构数据流:模型生成原图中不存在的流向关系
- 数据流信息错误:流向的起止节点、传输内容等与原图不符
可行优化方案
- 结构化提示约束:设计固定格式的提示模板,要求模型严格按照「数据源→数据接收方→数据内容」的三元组格式输出,同时明确要求“无对应数据则标注‘无’”,从根源上限制虚构行为
- 多模型交叉校验:使用至少两款不同的视觉模型分别提取数据流,对比输出结果,对差异项进行人工复核,降低单一模型的错误率
- 图表预处理强化:对原图进行灰度化、对比度提升等预处理,提高OCR识别准确率;同时手动给图表中的节点、数据流添加临时编号,帮助模型精准定位每个流的起止对象
- 规则引擎后置校验:基于系统业务逻辑设置规则引擎,比如“数据只能从上游节点流向下游节点”“核心节点的数据流需覆盖预设业务场景”,自动过滤不符合逻辑的错误结果
内容的提问来源于stack exchange,提问作者yixiang
相关产品推荐
相关产品推荐

