You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Pandas将Excel表格转换为可处理的数据集?

使用Pandas处理Excel表格的实操指南

1. 准备依赖库

Pandas读取Excel文件需要额外依赖包,根据文件格式选择安装:

  • 处理.xlsx文件:执行 pip install openpyxl
  • 处理.xls文件:执行 pip install xlrd==1.2.0(新版xlrd不再支持xlsx格式)

2. 读取Excel文件

通过pd.read_excel()将Excel文件加载为Pandas的核心数据结构DataFrame,示例代码如下:

import pandas as pd 
# 路径前加r避免转义字符问题,sheet_name指定目标工作表(可填名称或索引,0代表第一个工作表)
df = pd.read_excel(r"c:/Users/vpullabh/Desktop/Meraci.Ec-NGIOSD.xlsx", sheet_name="sheet1")
# 打印前5行数据验证读取结果
print(df.head())

3. 常用数据处理操作

读取完成后可执行各类数据处理操作:

  • 查看数据概况:
    • df.info():查看各列数据类型、非空值数量
    • df.describe():生成数值列的统计摘要(均值、中位数、极值等)
  • 数据清洗:
    • 移除含缺失值的行:df = df.dropna()
    • 用指定值填充缺失值:df = df.fillna(0)
    • 删除重复行:df = df.drop_duplicates()
  • 筛选与查询:
    • 按条件筛选行:filtered_df = df[df['销售额'] > 1000]
    • 选择指定列:selected_cols = df[['姓名', '部门']]
  • 修改与计算:
    • 新增计算列:df['税后工资'] = df['税前工资'] * 0.85
    • 修改指定行/列的值:df.loc[df['姓名'] == '张三', '部门'] = '技术部'
  • 保存处理结果:
    将处理后的数据导出为新Excel文件:
    # index=False表示不保存Pandas自动生成的索引列
    df.to_excel("处理完成的数据.xlsx", index=False, engine='openpyxl')
    

内容的提问来源于stack exchange,提问作者Vaishnavi Pullabhatla

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.01 23:20:01