You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

寻求优雅的DataFrame列循环处理偏度的Python实现方案

问题描述

我打算用以下代码处理DataFrame中部分列的偏度:

upper_limit = df['column1'].mean() + 3*df['column1'].std()
lower_limit = df['column1'].mean() - 3*df['column1'].std()
df['column1'] = np.where(df['column1'] > upper_limit, upper_limit, np.where(df['column1'] < lower_limit, lower_limit, df['column1']))

复制这段代码逐个处理列虽然可行,但我希望有更优雅的实现方式。试写了几个循环版本效果都不理想,求简洁美观的Python实现方案?

注:我不想删除异常值,且已经用np.log()做过处理。


可行解决方案

@Yes提供的方案完全适用:

def handle_skewness(column):
    upper_limit = column.mean() + 3 * column.std()
    lower_limit = column.mean() - 3 * column.std()
    return np.where(column > upper_limit, upper_limit, np.where(column < lower_limit, lower_limit, column))

# 遍历DataFrame的列
for column in X.columns:
    # 检查列是否为数值型(可根据需求自定义判断条件)
    if np.issubdtype(X[column].dtype, np.number):
        X[column] = handle_skewness(X[column])

内容的提问来源于stack exchange,提问作者Mariya Ivanova

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.04 02:02:08