You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用pdfplumber提取PDF表格后,如何修正DataFrame格式错误?

处理PDF提取后混乱的DataFrame

核心操作步骤

直接通过Pandas对目标行进行列内容合并,并清理冗余行:

  1. 合并指定行的列内容:将第6行与第7行、第8行与第9行、第10行与第11行的第2列说明文本合并到对应行的第1列
  2. 删除冗余空白行:移除合并后不再需要的第7、9、11行
  3. 重置索引:保证行索引连续

实现代码

import pandas as pd

# 假设df是你用pdfplumber提取得到的DataFrame
# 合并ONGC及其区块说明
df.loc[6, 0] = f"{df.loc[6, 0].strip()} {df.loc[7, 1].strip()}"
# 合并OIL及其区块说明
df.loc[8, 0] = f"{df.loc[8, 0].strip()} {df.loc[9, 1].strip()}"
# 合并Pvt/JVs及其区块说明
df.loc[10, 0] = f"{df.loc[10, 0].strip()} {df.loc[11, 1].strip()}"

# 删除冗余行
df = df.drop(index=[7, 9, 11]).reset_index(drop=True)

# 可选:清理所有None值为空白字符串(按需使用)
df = df.fillna("")

处理后效果示例

处理后的DataFrame第1列会呈现如下格式:

  • ONGC (Nomination Block)
  • OIL (Nomination Block)
  • Pvt/JVs (PSC/RSC Regime)
    其余数据行也会自动对齐,不再有空白行干扰。

内容的提问来源于stack exchange,提问作者Trepetaky

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.11 20:15:15