确认sklearn IsolationForest中decision_function的理解并补充内容
关于sklearn IsolationForest中
decision_function的解读(默认contamination场景) 你的理解完全准确:在contamination取默认值('auto',对应数据集异常占比约10%)时,decision_function的输出表现如下:
- 越接近**-1**:模型对该样本是异常值的置信度越高
- 越接近0:样本越倾向于被判定为正常样本
补充几个关键细节:
- 与
score_samples的关联:decision_function(X) = 0.5 - score_samples(X)。score_samples输出的是样本在隔离树中的平均路径长度归一化值,值越小代表样本被隔离的路径越短,异常程度越高。 - 默认阈值逻辑:当
contamination='auto'时,模型会自动选取decision_function的某个阈值,将数据集中约10%的样本标记为异常值。 - 参数调整后的趋势一致性:即便后续修改
contamination参数,decision_function的输出范围和核心趋势不会改变——依然是数值越靠近-1,样本异常的可能性越高;0附近是正常样本的典型输出区间。
内容的提问来源于stack exchange,提问作者Mar
相关产品推荐
相关产品推荐

