能否在pandas lambda函数内部访问并修改Python全局变量?
pandas lambda函数内修改全局状态的实现方法
你原来的写法无法生效有两个核心原因:
- Python中整数属于不可变类型,作为参数传入函数时传递的是值拷贝,函数内部对参数的赋值只会修改局部变量的指向,不会同步到外部的原变量
- lambda的默认参数是在lambda定义阶段就完成绑定的,后续原全局变量更新也不会改变lambda默认参数的取值,所以每次调用do_something拿到的都是初始值5
方法1:使用可变类型存储状态
最简单的方案是把需要修改的状态放到列表、字典这类可变类型中,修改可变对象的内部内容不会改变对象的内存引用,所以全局状态会同步更新,后续行调用lambda时就能拿到最新值。
示例代码:
import pandas as pd def do_something(x, state): current_val = state[0] print(current_val) if current_val > 0: state[0] = -1 return x / 2 else: state[0] = 1 return 2 * x # 初始化测试数据 df = pd.DataFrame({'val': [1, 2, 3, 4]}) # 用列表存储状态(列表是可变类型) state = [5] df['res'] = df['val'].apply(lambda x: do_something(x, state))
方法2:用类封装状态(更推荐)
如果不想污染全局命名空间,可以用类把状态和计算逻辑封装在一起,可维护性更高,也避免多场景下的变量冲突。
示例代码:
class StateCalculator: def __init__(self, init_state): self.state = init_state def calc(self, x): print(self.state) if self.state > 0: self.state = -1 return x / 2 else: self.state = 1 return 2 * x # 调用 calculator = StateCalculator(5) df['res'] = df['val'].apply(lambda x: calculator.calc(x))
注意:pandas的apply默认会对第一行执行两次调用用于类型推断,如果你的逻辑对执行次数敏感,可以在apply时添加
engine='python'参数,或者改用逐行遍历的方式处理。
内容的提问来源于stack exchange,提问作者scrollex
相关产品推荐
相关产品推荐

