如何用Python识别极端异常值?Z-score代码误判问题求助
问题分析
你的问题根源在于全局计算Z-score:EWC与BMW的销售额量级差异极大,全局均值和标准差会被EWC的大额数据主导,导致BMW的正常波动(15、20)相对于全局分布的Z-score超过阈值3,被误判为异常值。要仅识别极端异常,必须按卖家分组,基于每组自身的数据分布计算Z-score。
修正后的代码
假设你的DataFrame(df_all)包含标识卖家的列(示例中用Seller),修正代码如下:
import numpy as np from scipy import stats # 按卖家分组,对每组销售额计算绝对值Z-score df_all['z_score'] = df_all.groupby('Seller')['Sales'].transform(lambda x: np.abs(stats.zscore(x))) # 用阈值筛选极端异常值 threshold = 3 outliers = df_all[df_all['z_score'] > threshold] print(outliers)
关键说明
groupby('Seller'):将数据按卖家拆分,确保每个卖家的异常值判断基于自身的销售额分布,避免跨组数据干扰transform:保留原DataFrame的索引结构,将每组计算的Z-score映射回对应行- 若你的卖家列名不是
Seller,替换为实际列名即可 - 该方法适配大型DataFrame,pandas的
groupby操作针对大数据量做了性能优化
内容的提问来源于stack exchange,提问作者harry
相关产品推荐
相关产品推荐

