批量读取文件夹docx文件提取表格生成DataFrame报AttributeError求助
问题原因
- 循环遍历拿到的
document是仅包含文件名的字符串,没有通过Document()方法加载为python-docx的文档对象,直接调用.tables属性自然会触发字符串无该属性的报错。 - 存在变量覆盖逻辑错误:刚通过
pd.DataFrame(data)生成DataFrame对象,紧接着就被df='df_' + document覆盖为字符串,后续调用df.iloc也会触发同类属性报错。 - 缺少文件路径拼接逻辑:
os.walk返回的文件名是相对路径,需要和当前遍历的根路径拼接为完整路径,才能正常加载docx文件。
修复后可运行的完整代码
import pandas as pd from docx import Document import os directory = 'C:\\folder1\\Folder2\\Folder3\\Folder4' def read_docx_table(document,table_num=1,nheader=1): table = document.tables[table_num-1] data = [[cell.text for cell in row.cells] for row in table.rows] df = pd.DataFrame(data) if nheader == 1: df = df.rename(columns=df.iloc[0]).drop(df.index[0]).reset_index(drop=True) elif nheader == 2: outside_col, inside_col = df.iloc[0], df.iloc[1] hier_index = pd.MultiIndex.from_tuples(list(zip(outside_col,inside_col))) df = pd.DataFrame(data, columns=hier_index).drop(df.index[[0,1]]).reset_index(drop=True) elif nheader > 2: print("Not Working") return pd.DataFrame() return df # 用字典存储所有生成的DataFrame,key为df_文件名,value为对应DataFrame df_collection = {} table_num = 4 nheader = 2 for root, dirs, files in os.walk(directory): for file_name in files: if file_name.endswith('.docx'): # 拼接完整文件路径 full_path = os.path.join(root, file_name) # 加载docx文档对象 doc = Document(full_path) # 调用已验证的读取函数生成DataFrame current_df = read_docx_table(doc, table_num, nheader) # 存入字典 df_key = f'df_{file_name.replace(".docx", "")}' df_collection[df_key] = current_df # 可选打印确认 print(f'{df_key} 已处理完成,共{len(current_df)}行数据')
运行后所有docx对应的DataFrame都存储在df_collection字典中,可通过df_collection['df_你的文件名']的方式直接调用对应数据。
内容的提问来源于stack exchange,提问作者coding-zero
相关产品推荐
相关产品推荐

