如何将从PDF提取的数据保存至Word文档?
直接将PDF提取文本保存到Word的Python方案
安装所需依赖库:
pip install python-docx修改原有代码,实现直接写入Word文档:
from PyPDF2 import PdfReader from docx import Document # 初始化Word文档对象 doc = Document() reader = PdfReader(r'C:\Users\felip\Downloads\Edital 274 2022 Estágio Direito.pdf') total_pages = len(reader.pages) for page_num in range(total_pages): page = reader.pages[page_num] extracted_text = page.extract_text() # 将每页提取的文本添加为Word段落 doc.add_paragraph(extracted_text) # 可选:在除最后一页外的每页末尾添加分页符,匹配PDF分页结构 if page_num != total_pages - 1: doc.add_page_break() # 保存生成的Word文档 doc.save('PDF提取内容.docx')关键说明:
- 该方案无需通过Excel或记事本中转,直接将PDF提取的文本写入Word文档
- 保留PDF分页结构的需求可通过
add_page_break()实现,不需要可删除对应代码行 - 可修改
save()方法的参数指定文档保存路径,例如doc.save(r'C:\Users\felip\Documents\提取结果.docx')
内容的提问来源于stack exchange,提问作者Felipe
相关产品推荐
相关产品推荐

