You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Tabula读取PDF转CSV时列拆分至无名列的问题求助

问题:Tabula读取PDF时列内容拆分至无名列,限制列后丢失内容

我正在编写Python脚本,使用Tabula读取PDF并将DataFrame转换为CSV。尝试了convert_into和read_pdf两种方法,它们能返回指定的所有页面,但部分原列的内容被拆分至Unnamed: 0、Unnamed: 1这类无名列中。我尝试用DataFrame的columns属性限制返回列,虽能移除无名列,但同时也丢失了这些列中的文本内容。

第一段代码

page = t.read_pdf(path,stream=True, encoding="UTF-8", pages=paginas, multiple_tables=True, guess=True,format="pdf")
df = pd.DataFrame([])
for i in range(len(page)):
        page[i] = pd.DataFrame(page[i])
        df = pd.concat([df,page[i]])
dataAtual = datetime.datetime.now()
saida = destino+"/ErrNFE"+str(dataAtual)+".csv"
df.to_csv(saida, encoding="UTF-8", sep=";")

输出描述:LibreOffice Calc输出片段显示,结果中存在多个以Unnamed:开头的无名列,这些列包含原本应属于其他目标列的文本内容。

第二段代码

page = t.read_pdf(path,stream=True, encoding="UTF-8", pages=paginas, multiple_tables=True, guess=True,format="pdf")
df = pd.DataFrame([])
for i in range(len(page)):
        page[i] = pd.DataFrame(page[i],columns=({'Campo-Seq':[1,2], 'Modelo':[1,2], 'Regra de Validação':[1,2], 'Aplic.':[1,2], 'Msg':[1,2],'Efeito':[1,2],'Descrição Erro':[1,2]}))
        df = pd.concat([df,page[i]])
dataAtual = datetime.datetime.now()
saida = destino+"/ErrNFE"+str(dataAtual)+".csv"
df.to_csv(saida, encoding="UTF-8", sep=";")

输出描述:限制列后的LibreOffice Calc输出片段显示,无名列已被移除,但原本在这些无名列中的文本内容也随之丢失,对应单元格为空。

内容的提问来源于stack exchange,提问作者Luiz Maleico

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.06 11:10:19