You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将目录下多个PDF解析后按文件名存储并整合为单个字典

PDF批量解析整合代码修改方案

你可以直接参考以下修改后的代码实现需求:

import glob

# 初始化存储所有PDF信息的总字典
pdf_total_dict = {}
# 仅匹配PDF格式文件,避免非目标文件进入解析流程
files = glob.glob("*.pdf")

for file in files:
    # 解析当前PDF文件
    parse_res = parser.from_file(file, xmlContent=True)
    # 生成当前PDF对应的独立字典
    single_pdf_info = {
        "file_name": file,
        "file_content": parse_res["content"],
        "metadata": parse_res["metadata"]
    }
    # 将单文件字典加入总字典,以文件名作为检索键
    pdf_total_dict[file] = single_pdf_info

代码说明

  • 优化了原有的文件匹配规则,将*.*替换为*.pdf,避免目录下的非PDF文件被误解析
  • 新增总字典pdf_total_dict统一存储所有解析结果,你可以后续直接通过pdf_total_dict[目标文件名]快速调取对应文件的所有信息
  • 每个单文件字典严格按照要求存储了文件名、文件解析内容、PDF元数据三个字段
    如果你的parser返回结果的字段名和上述示例不一致,直接替换parse_res后的键名即可。

内容的提问来源于stack exchange,提问作者Pragyan Prakash Parida

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.05 12:27:05