You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

DataFrame分组聚合时如何对字符串格式NaN做差异化处理?

解决DataFrame分组合并时保留全'nan'分组原行的问题

解决办法其实很简单,把数据集拆成两部分分别处理,再合并结果:

  • 对TIN和PIN不全是字符串'nan'的行,正常按这两列分组,用逗号合并单元格值
  • 对TIN和PIN全是'nan'的行,直接保留原始行,不做合并

代码实现

import pandas as pd

# 拆分出TIN/PIN不全为'nan'的行,以及全为'nan'的行
non_nan_part = df[~((df['TIN'] == 'nan') & (df['PIN'] == 'nan'))]
all_nan_part = df[(df['TIN'] == 'nan') & (df['PIN'] == 'nan')]

# 处理非全nan的部分:分组合并
non_nan_merged = non_nan_part.groupby(['TIN', 'PIN']).agg(', '.join).reset_index()

# 合并两部分结果,重置索引
final_df = pd.concat([non_nan_merged, all_nan_part], ignore_index=True)

效果说明

这样处理后就能得到你想要的结果:

  • 像PIN=1、PIN=3这类非nan的分组,会正常合并成逗号分隔的字符串
  • TIN和PIN都为'nan'的行,每一行的Column值都会单独保留,不会被合并成一个长字符串

内容的提问来源于stack exchange,提问作者Devansh Gupta

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 07:52:19