如何将目录下多个PDF解析后按文件名存储并整合为单个字典
PDF批量解析整合代码修改方案
你可以直接参考以下修改后的代码实现需求:
import glob # 初始化存储所有PDF信息的总字典 pdf_total_dict = {} # 仅匹配PDF格式文件,避免非目标文件进入解析流程 files = glob.glob("*.pdf") for file in files: # 解析当前PDF文件 parse_res = parser.from_file(file, xmlContent=True) # 生成当前PDF对应的独立字典 single_pdf_info = { "file_name": file, "file_content": parse_res["content"], "metadata": parse_res["metadata"] } # 将单文件字典加入总字典,以文件名作为检索键 pdf_total_dict[file] = single_pdf_info
代码说明
- 优化了原有的文件匹配规则,将
*.*替换为*.pdf,避免目录下的非PDF文件被误解析 - 新增总字典
pdf_total_dict统一存储所有解析结果,你可以后续直接通过pdf_total_dict[目标文件名]快速调取对应文件的所有信息 - 每个单文件字典严格按照要求存储了文件名、文件解析内容、PDF元数据三个字段
如果你的parser返回结果的字段名和上述示例不一致,直接替换parse_res后的键名即可。
内容的提问来源于stack exchange,提问作者Pragyan Prakash Parida
相关产品推荐
相关产品推荐

