You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使llama-parse解析表格PDF时输出结果保持一致?

问题:Llama-Parse解析PDF输出格式不一致,表格丢失Markdown格式

代码示例

import os
import pandas as pd

import nest_asyncio 
nest_asyncio.apply()

os.environ["LLMA_CLOUD_API_KEY"] = "some_key_id"
key_input = "some_key_id"

from llama_parse import LlamaParse

# running llama parsing
doc_parsed = LlamaParse(result_type="markdown",api_key=key_input
                        ).load_data(r"Path\myfile.pdf")

问题描述

用上述代码解析同一PDF文档,当前输出和上月结果存在差异:上月解析出的表格是带|分隔符的标准Markdown表格,现在变成了分行文本形式。需要输出稳定一致(至少测试结果部分保留Markdown表格格式),才能基于固定逻辑搭建分析程序。

疑问点

  1. 是否是后台模型更新导致的输出变化?
  2. 能不能通过固定模型版本或调整参数实现输出稳定?

解决方案

  1. 固定模型版本
    Llama-Parse支持指定具体模型版本,避免后台自动更新带来的格式变动。初始化时添加model参数,指定之前能稳定输出的模型版本即可,示例:
doc_parsed = LlamaParse(
    result_type="markdown",
    api_key=key_input,
    model="llama-3-70b-chat"  # 替换为实际可用的稳定模型版本
).load_data(r"Path\myfile.pdf")
  1. 添加解析指令约束格式
    通过parsing_instruction参数明确要求模型输出Markdown表格,强制约束格式,示例:
doc_parsed = LlamaParse(
    result_type="markdown",
    api_key=key_input,
    parsing_instruction="文档中的所有表格必须以标准Markdown表格格式输出,使用|作为列分隔符,保留原有行列结构"
).load_data(r"Path\myfile.pdf")
  1. 关于后台模型更新的影响
    是的,很大概率是Llama-Parse后台模型迭代更新导致的输出格式变化。云端服务通常会自动升级模型优化效果,但可能会打破原有输出的兼容性,固定模型版本是解决这类问题的直接方案。

内容的提问来源于stack exchange,提问作者ViSa

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.18 13:13:14