如何用Python将CSV文件导入pandas并完成指定数据处理任务
Python导入CSV到pandas并完成指定操作步骤
前置准备
确保你已安装pandas库,未安装可执行pip install pandas完成安装。
1. 导入CSV并构建四个数据框
先导入pandas库,再读取对应CSV文件赋值到df1、df2、df3、df4四个数据框:
import pandas as pd # 四个数据集分别存为单独CSV时使用,替换引号内为你本地文件实际路径 df1 = pd.read_csv("dataset_I.csv") df2 = pd.read_csv("dataset_II.csv") df3 = pd.read_csv("dataset_III.csv") df4 = pd.read_csv("dataset_IV.csv") # 若四个数据集存在同一个CSV文件时使用,替换对应列名和文件路径即可 # all_df = pd.read_csv("总数据集.csv") # df1 = all_df[all_df["数据集分类列名"] == "I"] # df2 = all_df[all_df["数据集分类列名"] == "II"] # df3 = all_df[all_df["数据集分类列名"] == "III"] # df4 = all_df[all_df["数据集分类列名"] == "IV"]
你可执行df1.shape查看数据框行列数,确认每个数据框为11行2列,符合11组(x,y)数据要求。
2. 调用describe()计算基础描述性统计量
执行以下代码输出四个数据集的统计结果:
# 输出数据集I统计量 print("数据集I描述统计:") print(df1.describe()) # 输出数据集II统计量 print("\n数据集II描述统计:") print(df2.describe()) # 输出数据集III统计量 print("\n数据集III描述统计:") print(df3.describe()) # 输出数据集IV统计量 print("\n数据集IV描述统计:") print(df4.describe())
注意事项
- Windows系统下文件路径可以用正斜杠
/或者双反斜杠\\,避免单反斜杠触发转义报错 - 若导入数据不符合预期时,可调用
df1.head()查看前5行数据,核对CSV分隔符是否匹配,必要时在read_csv中添加sep="分隔符"参数调整
内容的提问来源于stack exchange,提问作者james duong
相关产品推荐
相关产品推荐

