Pandas读取Excel文件时如何忽略或删除标题和脚注内容?
实现方案
分两种场景处理,你可以根据自己的实际情况选:
场景1:已经把文件读取到DataFrame中
- 先确认要删除的头部标题行数、尾部脚注行数:
运行df.head(10)查看前10行内容,数清楚要删掉的头部行数;运行df.tail(10)查看后10行内容,数清楚要删掉的尾部行数。 - 用iloc切片直接过滤有效行:
假设需要删前2行标题、最后2行脚注,代码如下:# 切片左闭右开,2表示从第3行(索引从0开始)开始取,-2表示取到倒数第3行为止 df_clean = df.iloc[2:-2].reset_index(drop=True) - 如果有效行有明确的判定规则(比如某一列必须非空才是有效数据),可以用条件过滤,避免手动数行数出错:
比如主键列订单号必须非空才是有效数据,代码如下:df_clean = df[df['订单号'].notna()].reset_index(drop=True) - 如果你删除头部标题后,第一行是实际的列名,可以额外加一步设置列名的操作:
# 把第一行设为列名 df_clean.columns = df_clean.iloc[0] # 删除已经用作列名的第一行 df_clean = df_clean[1:].reset_index(drop=True)
场景2:可以重新读取文件(操作更简单,不需要二次处理)
直接在pd.read_excel里加参数跳过标题和脚注即可,示例如下:
import pandas as pd # skiprows设置跳过前N行标题,skipfooter设置跳过最后M行脚注 df = pd.read_excel("你的文件路径.xls", skiprows=2, skipfooter=2)
内容的提问来源于stack exchange,提问作者Mónica Larre Bolaños Cacho
相关产品推荐
相关产品推荐

