使用pdfplumber提取PDF表格后,如何修正DataFrame格式错误?
处理PDF提取后混乱的DataFrame
核心操作步骤
直接通过Pandas对目标行进行列内容合并,并清理冗余行:
- 合并指定行的列内容:将第6行与第7行、第8行与第9行、第10行与第11行的第2列说明文本合并到对应行的第1列
- 删除冗余空白行:移除合并后不再需要的第7、9、11行
- 重置索引:保证行索引连续
实现代码
import pandas as pd # 假设df是你用pdfplumber提取得到的DataFrame # 合并ONGC及其区块说明 df.loc[6, 0] = f"{df.loc[6, 0].strip()} {df.loc[7, 1].strip()}" # 合并OIL及其区块说明 df.loc[8, 0] = f"{df.loc[8, 0].strip()} {df.loc[9, 1].strip()}" # 合并Pvt/JVs及其区块说明 df.loc[10, 0] = f"{df.loc[10, 0].strip()} {df.loc[11, 1].strip()}" # 删除冗余行 df = df.drop(index=[7, 9, 11]).reset_index(drop=True) # 可选:清理所有None值为空白字符串(按需使用) df = df.fillna("")
处理后效果示例
处理后的DataFrame第1列会呈现如下格式:
ONGC (Nomination Block)OIL (Nomination Block)Pvt/JVs (PSC/RSC Regime)
其余数据行也会自动对齐,不再有空白行干扰。
内容的提问来源于stack exchange,提问作者Trepetaky
相关产品推荐
相关产品推荐

