使用Tabula读取PDF转CSV时列拆分至无名列的问题求助
问题:Tabula读取PDF时列内容拆分至无名列,限制列后丢失内容
我正在编写Python脚本,使用Tabula读取PDF并将DataFrame转换为CSV。尝试了convert_into和read_pdf两种方法,它们能返回指定的所有页面,但部分原列的内容被拆分至Unnamed: 0、Unnamed: 1这类无名列中。我尝试用DataFrame的columns属性限制返回列,虽能移除无名列,但同时也丢失了这些列中的文本内容。
第一段代码
page = t.read_pdf(path,stream=True, encoding="UTF-8", pages=paginas, multiple_tables=True, guess=True,format="pdf") df = pd.DataFrame([]) for i in range(len(page)): page[i] = pd.DataFrame(page[i]) df = pd.concat([df,page[i]]) dataAtual = datetime.datetime.now() saida = destino+"/ErrNFE"+str(dataAtual)+".csv" df.to_csv(saida, encoding="UTF-8", sep=";")
输出描述:LibreOffice Calc输出片段显示,结果中存在多个以Unnamed:开头的无名列,这些列包含原本应属于其他目标列的文本内容。
第二段代码
page = t.read_pdf(path,stream=True, encoding="UTF-8", pages=paginas, multiple_tables=True, guess=True,format="pdf") df = pd.DataFrame([]) for i in range(len(page)): page[i] = pd.DataFrame(page[i],columns=({'Campo-Seq':[1,2], 'Modelo':[1,2], 'Regra de Validação':[1,2], 'Aplic.':[1,2], 'Msg':[1,2],'Efeito':[1,2],'Descrição Erro':[1,2]})) df = pd.concat([df,page[i]]) dataAtual = datetime.datetime.now() saida = destino+"/ErrNFE"+str(dataAtual)+".csv" df.to_csv(saida, encoding="UTF-8", sep=";")
输出描述:限制列后的LibreOffice Calc输出片段显示,无名列已被移除,但原本在这些无名列中的文本内容也随之丢失,对应单元格为空。
内容的提问来源于stack exchange,提问作者Luiz Maleico
相关产品推荐
相关产品推荐

