如何使用pandas从csv文件中提取指定信息并生成日期列表与统计概览?
具体实现方法
1. 读取CSV文件并预处理日期字段
首先导入pandas库并读取目标文件,同时将日期列转换为pandas支持的datetime格式,方便后续处理:
import pandas as pd # 替换为你的CSV文件本地路径 df = pd.read_csv("your_file_path.csv") # 将日期列转换为日期类型,将'date'替换为你实际的日期字段列名 df['date'] = pd.to_datetime(df['date'])
提示:如果你的日期格式非常规(例如
2023/12/31、31-12-2023等),可以通过format参数指定匹配规则,示例:pd.to_datetime(df['date'], format="%d-%m-%Y")
2. 生成日期列表
根据需求选择对应代码即可:
- 提取去重后按时间排序的唯一日期列表:
date_list = df['date'].sort_values().drop_duplicates().tolist() - 提取保留原始重复值的全量日期列表:
date_list = df['date'].tolist()
3. 生成数据统计概览
使用pandas内置的describe()方法可快速生成多维度统计结果:
- 仅统计所有数值型字段(输出计数、均值、标准差、最小值、25%/50%/75%分位数、最大值):
stat_overview = df.describe() - 同时统计非数值型字段(额外输出计数、唯一值数量、出现频率最高的值及对应频次):
stat_overview = df.describe(include='all') - 仅统计指定字段的结果:
stat_overview = df[['字段1', '字段2']].describe()
需要查看结果直接调用print(stat_overview)即可输出结构化统计表格。
内容的提问来源于stack exchange,提问作者John
相关产品推荐
相关产品推荐

