如何将含图片数据的PDF文件转换为CSV或Excel格式表格数据
图片格式表格转CSV/Excel操作指南
待识别的表格图片:
方法1:用办公软件直接转换(适合单次少量操作)
- 先从PDF中导出目标表格图片,可直接用PDF阅读器截图保存为PNG格式。
- 打开WPS/Office 365,选择「插入」-「图片」,导入保存的表格图片。
- 右键点击插入的图片,选择「提取表格」,等待OCR识别完成。
- 核对识别出来的表格内容,修正数字、特殊字符等识别错误的部分,直接保存为.xlsx格式,或者另存为CSV格式即可。
方法2:用Python脚本处理(适合批量操作)
- 提前安装依赖:首先安装Tesseract OCR引擎,再安装Python依赖包,执行命令
pip install pytesseract pillow pandas openpyxl。 - 先对图片做预处理,调整对比度、去除噪点提升识别准确率,再调用pytesseract识别表格结构化内容,用pandas整理成表格后导出。核心逻辑参考:
import pytesseract from PIL import Image import pandas as pd # 读取预处理后的图片 img = Image.open("表格图片.png") # 识别表格内容 ocr_data = pytesseract.image_to_data(img, output_type=pytesseract.Output.DATAFRAME) # 过滤无效内容后整理成表格结构 processed_df = ocr_data[ocr_data["conf"] > 80][["text", "left", "top"]] # 根据表格行列坐标整理成标准表格后导出 processed_df.to_excel("输出结果.xlsx", index=False) processed_df.to_csv("输出结果.csv", index=False)
- 若需批量处理多个PDF中的图片表格,可配合
pdf2image库将PDF页面批量转成图片后统一识别。
注意事项
- OCR识别结果存在误差,导出前务必和原始图片内容核对,修正识别错误的内容后再保存。
内容的提问来源于stack exchange,提问作者SaQuiB
相关产品推荐
相关产品推荐


