DataFrame分组聚合时如何对字符串格式NaN做差异化处理?
解决DataFrame分组合并时保留全'nan'分组原行的问题
解决办法其实很简单,把数据集拆成两部分分别处理,再合并结果:
- 对TIN和PIN不全是字符串
'nan'的行,正常按这两列分组,用逗号合并单元格值 - 对TIN和PIN全是
'nan'的行,直接保留原始行,不做合并
代码实现
import pandas as pd # 拆分出TIN/PIN不全为'nan'的行,以及全为'nan'的行 non_nan_part = df[~((df['TIN'] == 'nan') & (df['PIN'] == 'nan'))] all_nan_part = df[(df['TIN'] == 'nan') & (df['PIN'] == 'nan')] # 处理非全nan的部分:分组合并 non_nan_merged = non_nan_part.groupby(['TIN', 'PIN']).agg(', '.join).reset_index() # 合并两部分结果,重置索引 final_df = pd.concat([non_nan_merged, all_nan_part], ignore_index=True)
效果说明
这样处理后就能得到你想要的结果:
- 像PIN=1、PIN=3这类非nan的分组,会正常合并成逗号分隔的字符串
- TIN和PIN都为
'nan'的行,每一行的Column值都会单独保留,不会被合并成一个长字符串
内容的提问来源于stack exchange,提问作者Devansh Gupta
相关产品推荐
相关产品推荐

