使用dill保存含numpy的sklearn Pipeline后预测出现NameError
解决Pipeline序列化后加载预测时的NameError问题
问题出在你用FunctionTransformer传入的lambda函数lambda x: np.log1p(x)上。当用dill序列化模型时,匿名lambda不会自动捕获外部的np命名空间依赖——哪怕加载模型的脚本里导入了numpy,序列化后的lambda内部依然找不到np的引用,导致transform阶段触发NameError。
给你两个可行的解决方法:
方法一:替换lambda为显式自定义函数
把lambda换成带内部numpy导入的自定义函数,确保序列化后加载时能正确找到依赖:
def log1p_transform(x): import numpy as np return np.log1p(x) # 替换Pipeline中对应的FunctionTransformer部分 make_pipeline( impute.SimpleImputer(), pr.FunctionTransformer(log1p_transform), StandardScaler(), )
方法二:直接传入numpy内置函数(更简洁)
跳过lambda,直接把np.log1p作为函数传给FunctionTransformer,序列化时会正确保存函数引用:
# 替换Pipeline中对应的FunctionTransformer部分 make_pipeline( impute.SimpleImputer(), pr.FunctionTransformer(np.log1p), StandardScaler(), )
修改后重新训练模型、保存,再在目标脚本加载预测,即可解决np未定义的错误。
内容的提问来源于stack exchange,提问作者sergiomahi
相关产品推荐
相关产品推荐

