You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python中Pandas透视表保留非NaN数据交集的最优方法

解决方法

要保留各列非NaN数据的交集(即所有列均无缺失值的行),同时确保结果从指定日期2004-11-19开始,可以按以下步骤操作:

1. 确保索引为 datetime 类型

先确认透视后的DataFrame索引是datetime格式,若不是则转换:

import pandas as pd

# 转换索引为datetime(如果尚未转换)
pivot_df.index = pd.to_datetime(pivot_df.index)

2. 筛选所有列均无缺失值的行

通过布尔索引筛选出所有列都不为NaN的行,这一步就是保留各列非NaN数据的交集:

# 生成布尔掩码:每行所有列都非NaN则为True
valid_rows_mask = pivot_df.notna().all(axis=1)
# 筛选有效行
filtered_df = pivot_df[valid_rows_mask]

3. 截取指定起始日期之后的数据

最后筛选出从2004-11-19开始的部分:

final_df = filtered_df.loc['2004-11-19':]

合并成一步的简化写法

如果需要更简洁的代码,可以把步骤合并:

final_df = pivot_df[pivot_df.notna().all(axis=1)].loc['2004-11-19':]

补充场景处理

如果需要严格匹配各列非NaN日期的交集范围(即取所有列都有数据的日期集合),可以用以下方式:

# 获取每列非NaN的日期集合
valid_dates_per_col = [set(pivot_df[col].dropna().index) for col in pivot_df.columns]
# 求所有集合的交集
common_dates = set.intersection(*valid_dates_per_col)
# 转换为排序后的datetime索引,并筛选出>=2004-11-19的日期
filtered_dates = sorted([date for date in common_dates if date >= pd.to_datetime('2004-11-19')])
# 按筛选后的日期取数
final_df = pivot_df.loc[filtered_dates]

内容的提问来源于stack exchange,提问作者Chris

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.07 06:25:24