You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python识别极端异常值?Z-score代码误判问题求助

问题分析

你的问题根源在于全局计算Z-score:EWC与BMW的销售额量级差异极大,全局均值和标准差会被EWC的大额数据主导,导致BMW的正常波动(15、20)相对于全局分布的Z-score超过阈值3,被误判为异常值。要仅识别极端异常,必须按卖家分组,基于每组自身的数据分布计算Z-score。

修正后的代码

假设你的DataFrame(df_all)包含标识卖家的列(示例中用Seller),修正代码如下:

import numpy as np
from scipy import stats

# 按卖家分组,对每组销售额计算绝对值Z-score
df_all['z_score'] = df_all.groupby('Seller')['Sales'].transform(lambda x: np.abs(stats.zscore(x)))

# 用阈值筛选极端异常值
threshold = 3
outliers = df_all[df_all['z_score'] > threshold]
print(outliers)
关键说明
  • groupby('Seller'):将数据按卖家拆分,确保每个卖家的异常值判断基于自身的销售额分布,避免跨组数据干扰
  • transform:保留原DataFrame的索引结构,将每组计算的Z-score映射回对应行
  • 若你的卖家列名不是Seller,替换为实际列名即可
  • 该方法适配大型DataFrame,pandas的groupby操作针对大数据量做了性能优化

内容的提问来源于stack exchange,提问作者harry

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.07 08:02:16