You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从PDF中提取非图片类型的矢量图表?寻求解决方案

从PDF中提取非图片类矢量图表的解决方案求助

我无法找到从PDF中分离或提取非图片类矢量图表的方法。曾尝试直接提取,但难度很大——用mupdf(fitz)编写的脚本仅能提取并保存图片,而我需要的是非图片格式的矢量图表,这类图表在PDF中的存储方式显然不同。

以下是我使用的脚本:

import fitz
import os
import io
from PIL import Image

pdf_path = 'path to pdf'
output_folder = 'your output folder'
os.makedirs(output_folder, exist_ok=True)

doc = fitz.open(pdf_path)
chart_count = 0

page = doc.load_page(0)
img_list = page.get_images(full=True )
for img_index, img in enumerate(img_list):
    base_image = doc.extract_image(img[0])
    image_bytes = base_image["image"]
    image = Image.open(io.BytesIO(image_bytes))
    image_path = os.path.join(output_folder, 
        f"chart_{chart_count+1}.png")
    image.save(image_path)
    chart_count += 1

注:补充了原脚本缺失的io和PIL.Image导入语句,确保可正常运行。

该脚本仅对PDF中的图片类型内容处理效果良好,无法提取矢量图表。请问有相关建议或解决方案吗?

示例PDF中存在部分无法被现有脚本提取的矢量图表。


内容的提问来源于stack exchange,提问作者ravshanovbek

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.14 14:45:58