如何用Python将图片表格行的各列内容提取为列表
提取图片中竖线分隔的表格列内容方法
图片文字提取(OCR)
先用光学字符识别工具把图片里的文本转成字符串。比如用Python的pytesseract库,代码示例:import pytesseract from PIL import Image # 加载图片 img = Image.open("Y69bI.png") # 提取文本 raw_text = pytesseract.image_to_string(img)这一步会把图片里的竖线分隔内容转成带竖线的文本串,可能会夹杂换行或多余空格,后续再处理。
文本分割与清洗
把提取到的文本按竖线|分割,同时清理每个元素的前后空格:# 移除换行符并去掉首尾空白 cleaned_text = raw_text.replace("\n", "").strip() # 分割并清洗每一项 column_list = [item.strip() for item in cleaned_text.split("|")]运行后就能得到目标列表:
['Sl No','Description of Goods','HSN/SAC','Quantity','Rate','per','Amount']额外提示
- 如果OCR识别出的竖线不准确(比如识别成破折号或遗漏),可以先对图片做预处理(比如调亮、去噪)提升识别精度,或者手动指定分割符;
- 要是只处理单张图片,也可以用在线OCR工具提取文本后,直接用文本编辑器按竖线分割整理,不用写代码。
内容的提问来源于stack exchange,提问作者ReaL_HyDRA
相关产品推荐
相关产品推荐

