You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Scikit-learn获取XGBoost决策函数?为何predict_proba与得分不同?

如何获取XGBoost分类器的决策函数及predict_proba与得分的差异

好问题!我来帮你拆解这两个关键点:

获取XGBoost分类器的决策函数

在Scikit-learn封装的XGBClassifier中,你可以直接调用decision_function(X)方法来获取模型的原始决策得分,用法和Scikit-learn原生的梯度提升树完全一致。这个方法返回的是模型未经过概率转换的原始输出——也就是所有决策树叶子节点的加权和。

举个实际的代码例子:

from xgboost import XGBClassifier
from sklearn.datasets import make_classification
from sklearn.model_selection import train_test_split

# 生成二分类示例数据
X, y = make_classification(n_samples=1000, random_state=42)
X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=42)

# 初始化并训练XGBoost分类器(注意关闭默认的标签编码器,避免警告)
model = XGBClassifier(use_label_encoder=False, eval_metric="logloss", random_state=42)
model.fit(X_train, y_train)

# 获取决策函数的原始得分
decision_scores = model.decision_function(X_test)
# 获取正类的预测概率(二分类场景)
positive_class_probs = model.predict_proba(X_test)[:, 1]

如果是多分类任务,decision_function会返回形状为(n_samples, n_classes)的数组,每个元素对应样本属于该类别的原始得分;而predict_proba则是经过softmax转换后的概率分布。

为什么predict_proba与决策函数得分存在差异

这两者的核心区别在于是否经过概率转换:

  • 决策函数(decision_function):输出的是模型的原始预测得分。对于二分类任务,这个得分是logit值(也就是log(正类概率/负类概率));对于多分类任务,是每个类别的logit得分。它完全是模型内部计算的原始结果,没有经过任何非线性转换。
  • predict_proba:是将决策函数的得分通过概率转换函数处理后的结果:
    • 二分类场景:用sigmoid函数转换,公式为 prob = 1 / (1 + exp(-decision_score)),正类概率是这个值,负类概率就是1 - prob。
    • 多分类场景:用softmax函数转换,每个类别的概率为 exp(decision_score_i) / sum(exp(decision_score_all_classes))。

你观察到Scikit-learn原生GradientBoostingClassifier的predict_proba和decision_function不等价,这是完全正常的——它们本来就不是一回事:一个是概率化后的结果,一个是原始模型得分。

另外补充一点:绘制ROC曲线时,用decision_function的原始得分或者predict_proba的正类概率,最终得到的ROC曲线是完全一致的。因为ROC曲线只关注样本的排序关系,而sigmoid/softmax都是单调递增函数,不会改变样本的相对排序。你可以根据自己的习惯选择其中一种即可。

内容的提问来源于stack exchange,提问作者user7867665

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.22 09:46:45