You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用pandas从csv文件中提取指定信息并生成日期列表与统计概览?

具体实现方法

1. 读取CSV文件并预处理日期字段

首先导入pandas库并读取目标文件,同时将日期列转换为pandas支持的datetime格式,方便后续处理:

import pandas as pd

# 替换为你的CSV文件本地路径
df = pd.read_csv("your_file_path.csv")
# 将日期列转换为日期类型,将'date'替换为你实际的日期字段列名
df['date'] = pd.to_datetime(df['date'])

提示:如果你的日期格式非常规(例如2023/12/31、31-12-2023等),可以通过format参数指定匹配规则,示例:pd.to_datetime(df['date'], format="%d-%m-%Y")

2. 生成日期列表

根据需求选择对应代码即可:

  • 提取去重后按时间排序的唯一日期列表:
    date_list = df['date'].sort_values().drop_duplicates().tolist()
  • 提取保留原始重复值的全量日期列表:
    date_list = df['date'].tolist()

3. 生成数据统计概览

使用pandas内置的describe()方法可快速生成多维度统计结果:

  • 仅统计所有数值型字段(输出计数、均值、标准差、最小值、25%/50%/75%分位数、最大值):
    stat_overview = df.describe()
  • 同时统计非数值型字段(额外输出计数、唯一值数量、出现频率最高的值及对应频次):
    stat_overview = df.describe(include='all')
  • 仅统计指定字段的结果:
    stat_overview = df[['字段1', '字段2']].describe()

需要查看结果直接调用print(stat_overview)即可输出结构化统计表格。

内容的提问来源于stack exchange,提问作者John

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 10:36:07