You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

二分类任务中如何将SHAP值转换为特征百分比贡献度

独热编码场景下聚合SHAP值计算原始特征贡献占比的方案校验

你的思路核心逻辑是成立的,但有3个关键细节处理不当会直接导致结果不符合预期,具体说明如下:

  • 首先明确方案的适用边界:针对单样本、二分类state-1类别的归因场景,将同属一个原始分类特征的独热编码子维度SHAP值聚合,再归一化为百分比的操作,是工业界处理独热编码SHAP归因的通用做法,符合SHAP值的加性特征属性。
  • 不要直接对所有SHAP值取绝对值再归一化:SHAP值自带方向属性,正值代表特征将预测结果向state-1方向推动,负值代表将结果向state-0方向推动。直接取绝对值只能得到特征的影响幅度占比,无法体现特征对判定为state-1的支持/反对方向,和你提出的「表征对模型判定样本为state-1而非state-0的贡献程度」的目标不完全匹配。如果仅需要衡量特征影响大小,取绝对值操作可行;如果需要保留贡献方向,必须保留SHAP值的正负号再做计算。
  • 不要重复计算双标签的SHAP值:你的标签是二分类互斥的state-1和state-0,两个输出维度的SHAP值完全负相关,计算时只需要提取模型输出中对应state-1分支的SHAP值即可,同时纳入两个分支的结果会导致贡献值翻倍、占比完全失真。
  • 注意独热编码的参考组贡献:你当前的数据集对分类特征做了全维度独热编码(没有丢弃参考维度避免共线性),直接把ranking-A/B/C、color-red/blue/green的SHAP值分别求和即可得到两个原始特征的总SHAP贡献;如果后续你为了避免多重共线性在独热编码时丢弃了一个参考维度,必须补算参考维度对应的SHAP贡献(同组独热特征的SHAP值总和为该原始特征的总贡献,参考维度贡献等于其余非参考维度SHAP和的相反数),否则聚合得到的原始特征贡献会偏低。

适配你需求的正确计算步骤

  1. 调用SHAP Explainer时指定输出目标为state-1类别,仅获取6个输入特征维度对应的SHAP值,排除state-0分支的SHAP输出
  2. 按原始特征分组做SHAP值聚合:
    • ranking总SHAP贡献 = shap_value[ranking-A] + shap_value[ranking-B] + shap_value[ranking-C]
    • color总SHAP贡献 = shap_value[color-red] + shap_value[color-blue] + shap_value[color-green]
  3. 根据你的输出需求选择归一化方式:
    • 若需要带方向的贡献占比(正=推动判定为state-1,负=推动判定为state-0):将两个特征的总SHAP值除以两个值的绝对值之和,乘以100%即可,最终两个占比相加为0,符合SHAP的加性解释逻辑(所有特征贡献之和等于单样本预测值与数据集基准预测值的差)
    • 若需要无方向的影响幅度占比:对两个特征的总SHAP值取绝对值,除以两个绝对值的和后乘以100%,最终两个占比相加为100%,和你最初构思的输出形式一致

注意:如果你使用的是DeepExplainer、TreeExplainer这类支持精确SHAP值计算的解释器,上述计算结果严格符合SHAP的一致性要求;如果使用KernelExplainer这类基于采样的近似解释器,结果会存在小幅采样误差,属于正常现象。

内容的提问来源于stack exchange,提问作者ChronoVortex

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.28 22:42:33