Python中DataFrame数值变量分箱问题:如何将大于8的值归为‘8+’
解决DataFrame数值变量分箱问题
你的问题出在pd.cut的区间设置上:当前的bins只定义到8,所有大于8的数值不在任何指定区间内,会被标记为NaN,因此不会出现在value_counts()的结果里。下面提供两种可行的解决方案:
方法1:修正pd.cut的区间范围
给bins添加一个无穷大的上限,确保所有大于8的数值都能被分到最后一个区间:
import pandas as pd import numpy as np df['var1_binned'] = pd.cut( df['var1'], bins=[0, 1, 2, 3, 4, 5, 6, 7, 8, np.inf], labels=['1', '2', '3', '4', '5', '6', '7', '8', '8+'], right=True # 默认值,区间为左开右闭,(8, inf]会被归为'8+',8则归为'8' ) print(df['var1_binned'].value_counts())
方法2:用np.where直接判断(更简洁)
对于这种简单的分箱规则,直接使用条件判断更高效:
import numpy as np df['var1_binned'] = np.where(df['var1'] > 8, '8+', df['var1'].astype(str)) print(df['var1_binned'].value_counts())
两种方法都能让大于8的数值被正确归类到8+,并且在value_counts()中显示该类别的计数。
内容的提问来源于stack exchange,提问作者Dag2
相关产品推荐
相关产品推荐

