You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将从PDF提取的数据保存至Word文档?

直接将PDF提取文本保存到Word的Python方案
  • 安装所需依赖库:

    pip install python-docx
    
  • 修改原有代码,实现直接写入Word文档:

    from PyPDF2 import PdfReader
    from docx import Document
    
    # 初始化Word文档对象
    doc = Document()
    
    reader = PdfReader(r'C:\Users\felip\Downloads\Edital 274 2022 Estágio Direito.pdf')
    total_pages = len(reader.pages)
    
    for page_num in range(total_pages):
        page = reader.pages[page_num]
        extracted_text = page.extract_text()
        # 将每页提取的文本添加为Word段落
        doc.add_paragraph(extracted_text)
        # 可选:在除最后一页外的每页末尾添加分页符,匹配PDF分页结构
        if page_num != total_pages - 1:
            doc.add_page_break()
    
    # 保存生成的Word文档
    doc.save('PDF提取内容.docx')
    
  • 关键说明:

    • 该方案无需通过Excel或记事本中转,直接将PDF提取的文本写入Word文档
    • 保留PDF分页结构的需求可通过add_page_break()实现,不需要可删除对应代码行
    • 可修改save()方法的参数指定文档保存路径,例如doc.save(r'C:\Users\felip\Documents\提取结果.docx')

内容的提问来源于stack exchange,提问作者Felipe

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.30 15:03:25