You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python将图片表格行的各列内容提取为列表

提取图片中竖线分隔的表格列内容方法
  • 图片文字提取(OCR)
    先用光学字符识别工具把图片里的文本转成字符串。比如用Python的pytesseract库,代码示例:

    import pytesseract
    from PIL import Image
    
    # 加载图片
    img = Image.open("Y69bI.png")
    # 提取文本
    raw_text = pytesseract.image_to_string(img)
    

    这一步会把图片里的竖线分隔内容转成带竖线的文本串,可能会夹杂换行或多余空格,后续再处理。

  • 文本分割与清洗
    把提取到的文本按竖线|分割,同时清理每个元素的前后空格:

    # 移除换行符并去掉首尾空白
    cleaned_text = raw_text.replace("\n", "").strip()
    # 分割并清洗每一项
    column_list = [item.strip() for item in cleaned_text.split("|")]
    

    运行后就能得到目标列表:['Sl No','Description of Goods','HSN/SAC','Quantity','Rate','per','Amount']

  • 额外提示

    • 如果OCR识别出的竖线不准确(比如识别成破折号或遗漏),可以先对图片做预处理(比如调亮、去噪)提升识别精度,或者手动指定分割符;
    • 要是只处理单张图片,也可以用在线OCR工具提取文本后,直接用文本编辑器按竖线分割整理,不用写代码。

内容的提问来源于stack exchange,提问作者ReaL_HyDRA

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 06:13:13