如何使用Pandas将Excel表格转换为可处理的数据集?
使用Pandas处理Excel表格的实操指南
1. 准备依赖库
Pandas读取Excel文件需要额外依赖包,根据文件格式选择安装:
- 处理
.xlsx文件:执行pip install openpyxl - 处理
.xls文件:执行pip install xlrd==1.2.0(新版xlrd不再支持xlsx格式)
2. 读取Excel文件
通过pd.read_excel()将Excel文件加载为Pandas的核心数据结构DataFrame,示例代码如下:
import pandas as pd # 路径前加r避免转义字符问题,sheet_name指定目标工作表(可填名称或索引,0代表第一个工作表) df = pd.read_excel(r"c:/Users/vpullabh/Desktop/Meraci.Ec-NGIOSD.xlsx", sheet_name="sheet1") # 打印前5行数据验证读取结果 print(df.head())
3. 常用数据处理操作
读取完成后可执行各类数据处理操作:
- 查看数据概况:
df.info():查看各列数据类型、非空值数量df.describe():生成数值列的统计摘要(均值、中位数、极值等)
- 数据清洗:
- 移除含缺失值的行:
df = df.dropna() - 用指定值填充缺失值:
df = df.fillna(0) - 删除重复行:
df = df.drop_duplicates()
- 移除含缺失值的行:
- 筛选与查询:
- 按条件筛选行:
filtered_df = df[df['销售额'] > 1000] - 选择指定列:
selected_cols = df[['姓名', '部门']]
- 按条件筛选行:
- 修改与计算:
- 新增计算列:
df['税后工资'] = df['税前工资'] * 0.85 - 修改指定行/列的值:
df.loc[df['姓名'] == '张三', '部门'] = '技术部'
- 新增计算列:
- 保存处理结果:
将处理后的数据导出为新Excel文件:# index=False表示不保存Pandas自动生成的索引列 df.to_excel("处理完成的数据.xlsx", index=False, engine='openpyxl')
内容的提问来源于stack exchange,提问作者Vaishnavi Pullabhatla
相关产品推荐
相关产品推荐

