Python函数中如何传入DataFrame列名作为groupby操作参数?
解决DataFrameGroupBy无指定属性的问题
问题背景
我正尝试用函数优化重复的groupby操作,需要将DataFrame的列名作为参数传入函数。现有包含用户ID、用餐时间及血糖值的DataFrame,要获取最接近用餐时间的采样点(t_0)的血糖值,先创建了difference列表示用餐时间与测量时间的差值,原获取t_0的代码如下:
df_t0 = df.groupby(['user_id','meal_time'],as_index=False).difference.min().reset_index(name=reset_index)
因为代码中多次用到groupby且操作列名不固定,于是编写了如下函数:
def make_ff (self,gb1,gb2,gb3,what,reset_index): if what=='size': ff=self.groupby([gb1,gb2]).size().reset_index(name=reset_index) elif what=='min': ff=self.groupby([gb1,gb2]).gb3.min().reset_index(name=reset_index) elif what=='max': ff=self.groupby([gb1,gb2]).gb3.max().reset_index(name=reset_index) else: ff=self.groupby([gb1,gb2]).gb3.mean().reset_index(name=reset_index) return ff
调用时用了:
df_t0 =make_ff(cg,'user_id','meal_time','difference','min','difference','No')
但触发错误:
'DataFrameGroupBy' object has no attribute 'gb3'
尝试过eval(gb3)但未解决问题,需要帮助。
解决方法
核心问题
代码中用.gb3直接访问属性是错误的——gb3是你传入的列名字符串变量,DataFrameGroupBy对象不存在名为gb3的内置属性,必须用**索引语法[gb3]**来指定要操作的目标列。另外函数定义的参数数量和调用时传入的参数不匹配,也需要修正。
修正后的函数
def make_ff(df, gb1, gb2, gb3, what, reset_index): # 先完成分组操作,避免重复调用groupby grouped = df.groupby([gb1, gb2], as_index=False) if what == 'size': ff = grouped.size().reset_index(name=reset_index) elif what == 'min': ff = grouped[gb3].min().reset_index(name=reset_index) elif what == 'max': ff = grouped[gb3].max().reset_index(name=reset_index) else: ff = grouped[gb3].mean().reset_index(name=reset_index) return ff
正确调用示例
注意参数顺序:第一个参数是目标DataFrame,依次是分组列1、分组列2、要聚合的列、聚合方式、结果列名:
# 示例中将结果列名设为't0_difference',可根据实际需求修改 df_t0 = make_ff(cg, 'user_id', 'meal_time', 'difference', 'min', 't0_difference')
可选优化方案
如果需要支持更多聚合操作或更灵活的分组列(比如多个分组列),可以用agg方法简化函数:
def make_ff(df, group_cols, agg_col, agg_func, reset_index_name): return df.groupby(group_cols, as_index=False).agg({agg_col: agg_func}).rename(columns={agg_col: reset_index_name})
调用示例(支持传入分组列列表):
df_t0 = make_ff(cg, ['user_id', 'meal_time'], 'difference', 'min', 't0_difference')
内容的提问来源于stack exchange,提问作者Ibon Sarriegi Galdés
相关产品推荐
相关产品推荐

