You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

欺诈检测中不确定性估计与过采样的矛盾问题求解

针对欺诈检测中采样与不确定性异常问题的解决方案

问题根源分析

重复欺诈样本的过采样会让模型对少数类样本产生严重过拟合,导致模型对欺诈样本的输出置信度极高(不确定性极低),反而将未被重复采样的合法样本视为“分布外”或陌生样本,最终出现合法样本不确定性更高的反常情况。

具体解决方向

  • 优先尝试分层欠采样:不要随机丢弃合法样本,而是按域/交易类型对合法样本做分层欠采样,保留每个子域的核心分布特征,将比例调整至1:20或1:15(不用强行到1:10)。这种方式既能缓解类别不平衡,又不会让模型过度熟悉欺诈样本,能有效恢复正常的不确定性信号,同时避免丢失合法样本的关键模式。
  • 尝试自适应轻量过采样:如果部分域样本量不足以支撑生成式采样,可仅在样本充足的域使用ADASYN(自适应合成少数类样本),样本量少的域保留原比例。ADASYN会根据少数类样本的分布密度生成样本,比单纯重复样本更能维持分布合理性,降低模型过拟合少数类的概率。
  • 放弃采样,改用加权损失函数:
    • 使用Weighted Cross-Entropy Loss,给欺诈样本设置与类别比例匹配的权重(比如90),让模型在原不平衡数据上自动重视少数类,完全避免采样对样本分布的干扰,自然能保留正常的不确定性信号。
    • 进阶可尝试Focal Loss,通过降低易分类样本(大量合法样本)的损失权重,让模型聚焦于难分类的欺诈样本,同时维持输出置信度与不确定性的对应关系。
  • 结合集成架构校准不确定性:针对不同专家模型采用差异化策略——样本充足的专家用适度采样,样本稀缺的专家用加权损失,最后对所有专家的输出做温度缩放(temperature scaling)校准,统一调整置信度分布,让不确定性信号更符合“欺诈样本不确定性更高”的预期。

内容的提问来源于stack exchange,提问作者David Gomes

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.13 10:00:12