You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

CatBoost特征重要性PredictionValuesChange中v1、v2的Formula Value咨询

CatBoost PredictionValuesChange特征重要性:v1、v2的Formula Value详解

PredictionValuesChange是CatBoost中基于特征打乱法的特征重要性评估模块,核心逻辑是通过观察单个特征被随机打乱后模型预测结果的变化,量化特征对预测的影响程度。其中v1、v2是该模块下两种不同计算逻辑对应的Formula Value,具体细节如下:

v1的Formula Value

  • 定义:单特征打乱前后,所有样本预测值绝对变化量的算术平均值
  • 含义:反映特征被打乱后,模型对整体样本预测结果的平均波动幅度。这个值越大,说明该特征是模型做出预测的关键依赖项,对预测结果的整体影响越强。
  • 计算与判定标准:
    • 第一步:用训练好的模型计算所有样本的原始预测值集合Y_pred_original
    • 第二步:固定其他特征不变,随机打乱目标特征的取值,得到新特征矩阵后计算预测值集合Y_pred_shuffled
    • 第三步:对每个样本计算预测值的绝对差值|Y_pred_original[i] - Y_pred_shuffled[i]|
    • 第四步:取所有绝对差值的平均值,即为v1的Formula Value
    • 判定规则:值越高,特征重要性越高;若值趋近于0,说明该特征对模型预测几乎无贡献

v2的Formula Value

  • 定义:单特征打乱前后,所有样本预测值平方变化量的平均值的平方根(即预测值变化的均方根)
  • 含义:相比v1,v2通过平方放大了预测值的较大差异,更侧重捕捉那些对部分样本预测结果产生极端影响的特征。适合需要识别“少数关键样本的核心驱动特征”的场景。
  • 计算与判定标准:
    • 第一步:同v1,得到原始预测值Y_pred_original和打乱后的预测值Y_pred_shuffled
    • 第二步:对每个样本计算预测值的平方差值(Y_pred_original[i] - Y_pred_shuffled[i])²
    • 第三步:取所有平方差值的平均值后开平方根,得到v2的Formula Value
    • 判定规则:值越高,特征对模型预测的极端波动贡献越大,重要性越高;值越小,说明特征很难引发预测结果的大幅变化

两者的核心差异

v1是**平均绝对误差(MAE)视角的特征重要性,关注整体平均影响;v2是均方根误差(RMSE)**视角,对极端差异更敏感。实际使用中可根据分析目标选择:若要评估特征对整体预测的普遍影响,选v1;若要定位对部分样本预测起决定性作用的特征,选v2。

内容的提问来源于stack exchange,提问作者Nartdanai Muangniyom

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.03 14:45:26