You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何替换缺失值并按日期重排1988-2020年CSV数据?

问题描述

我有一份1988-2020年的CSV数据,格式特点如下:

  • 前两列是年份和月份(例如1988,1、2020,12)
  • 剩余列对应当月各日期的数值
  • 存在部分日期值缺失、部分月份缺失的情况

需要完成以下处理:

  1. 适配闰年规则,将缺失值替换为NA或-99
  2. 转换为目标格式,确保1988-01-01至2020-12-31无日期遗漏:
Column1,Column2
"dd-mm-yyyy", "Value"
解决方案(Python + Pandas)

以下是可直接运行的代码,包含完整的数据清洗、格式转换逻辑:

1. 导入依赖并读取原始数据

import pandas as pd

# 读取原始CSV(替换为你的文件路径)
df = pd.read_csv("your_data.csv", header=None)

# 重命名前两列,方便后续处理
df = df.rename(columns={0: "year", 1: "month"})

2. 生成完整日期序列

先创建目标时间范围内的所有日期,确保无遗漏(自动适配闰年):

# 生成1988-01-01到2020-12-31的所有日期
full_dates = pd.date_range(start="1988-01-01", end="2020-12-31", freq="D")
# 拆分年、月、日,用于后续匹配
full_df = pd.DataFrame({"date": full_dates})
full_df["year"] = full_df["date"].dt.year
full_df["month"] = full_df["date"].dt.month
full_df["day"] = full_df["date"].dt.day

3. 重塑原始数据为长格式

把原始数据的“宽格式”(每日期一列)转成“长格式”(每行对应一个日期的数值):

# 将日期列转为行数据,保留年月作为标识
melted_df = df.melt(id_vars=["year", "month"], var_name="day", value_name="Value")
# 把日期列名转为整数(原始列名是日期数字,可能是字符串格式)
melted_df["day"] = melted_df["day"].astype(int)

4. 合并数据并处理缺失值

将原始数据和完整日期表合并,填充缺失值:

# 按年、月、日匹配,保留所有完整日期
result_df = pd.merge(full_df, melted_df, on=["year", "month", "day"], how="left")

# 替换缺失值(二选一,根据需求切换)
result_df["Value"] = result_df["Value"].fillna("NA")  # 替换为NA
# result_df["Value"] = result_df["Value"].fillna(-99)  # 替换为-99

# 转换日期格式为dd-mm-yyyy
result_df["Column1"] = result_df["date"].dt.strftime("%d-%m-%Y")
# 提取目标列
final_df = result_df[["Column1", "Value"]]

5. 导出结果

# 导出为符合要求的CSV文件
final_df.to_csv("formatted_data.csv", index=False, quotechar='"')

关键说明

  • 闰年适配:pd.date_range会自动识别闰年,生成2月29日的日期,无需额外判断
  • 缺失值处理:通过左合并保留所有完整日期,原始数据中不存在的日期会自动填充NaN,再统一替换为指定值
  • 格式合规:最终导出的CSV严格匹配要求的格式,日期格式为dd-mm-yyyy

内容的提问来源于stack exchange,提问作者Bjrj92

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.16 23:55:32