如何提取DataFrame中stand_Gross.SqFt列经z-score判断为异常的对应行
直接适配当前代码的筛选实现
你现在的apply返回结果是字符串类型的'True'/'False',直接和'True'做等值判断得到布尔掩码后,即可用于行筛选,代码如下:
outlier_housing = housing[housing['stand_Gross.SqFt'].apply(zscore) == 'True']
代码优化建议
你当前自定义的zscore函数返回字符串属于不必要设计,直接返回布尔值可以省去类型判断步骤,修改后的逻辑如下:
# 优化后直接返回布尔值的zscore函数 def zscore(x): return x > 3 or x < -3 # 筛选代码直接使用返回的布尔序列即可 outlier_housing = housing[housing['stand_Gross.SqFt'].apply(zscore)]
更高性能的向量化实现(推荐)
pandas原生支持向量化比较运算,不需要用apply遍历每个元素,数据量较大时性能优势非常明显:
# 直接生成异常值布尔掩码 outlier_mask = (housing['stand_Gross.SqFt'] > 3) | (housing['stand_Gross.SqFt'] < -3) outlier_housing = housing[outlier_mask]
内容的提问来源于stack exchange,提问作者Shrey Patel
相关产品推荐
相关产品推荐

