You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将含图片数据的PDF文件转换为CSV或Excel格式表格数据

图片格式表格转CSV/Excel操作指南

待识别的表格图片:
表格示例

方法1:用办公软件直接转换(适合单次少量操作)

  • 先从PDF中导出目标表格图片,可直接用PDF阅读器截图保存为PNG格式。
  • 打开WPS/Office 365,选择「插入」-「图片」,导入保存的表格图片。
  • 右键点击插入的图片,选择「提取表格」,等待OCR识别完成。
  • 核对识别出来的表格内容,修正数字、特殊字符等识别错误的部分,直接保存为.xlsx格式,或者另存为CSV格式即可。

方法2:用Python脚本处理(适合批量操作)

  • 提前安装依赖:首先安装Tesseract OCR引擎,再安装Python依赖包,执行命令pip install pytesseract pillow pandas openpyxl。
  • 先对图片做预处理,调整对比度、去除噪点提升识别准确率,再调用pytesseract识别表格结构化内容,用pandas整理成表格后导出。核心逻辑参考:
import pytesseract
from PIL import Image
import pandas as pd

# 读取预处理后的图片
img = Image.open("表格图片.png")
# 识别表格内容
ocr_data = pytesseract.image_to_data(img, output_type=pytesseract.Output.DATAFRAME)
# 过滤无效内容后整理成表格结构
processed_df = ocr_data[ocr_data["conf"] > 80][["text", "left", "top"]]
# 根据表格行列坐标整理成标准表格后导出
processed_df.to_excel("输出结果.xlsx", index=False)
processed_df.to_csv("输出结果.csv", index=False)
  • 若需批量处理多个PDF中的图片表格,可配合pdf2image库将PDF页面批量转成图片后统一识别。

注意事项

  • OCR识别结果存在误差,导出前务必和原始图片内容核对,修正识别错误的内容后再保存。

内容的提问来源于stack exchange,提问作者SaQuiB

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.07 14:48:01