You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何按Outcome标签分组,用对应中位数填充数据集特征的0值?

解决按Outcome分组填充中位数的问题

核心思路

要实现按Outcome分组填充特征的中位数,关键是先将无效的0值转为NaN,再针对每个分组计算对应特征的中位数,最后用分组中位数填充该组内的NaN值。相比之前的全局均值填充,分组中位数更贴合不同类别数据的分布特征。

优化后的代码实现

可以用pandas的groupby结合transform方法高效完成这个操作,支持批量处理多个特征:

import numpy as np
import pandas as pd

def replace_zeros_with_group_median(df, target_columns):
    for col in target_columns:
        # 先将特征中的0值替换为NaN
        df[col] = df[col].replace(0, np.nan)
        # 按Outcome分组计算中位数,并填充对应组的NaN
        df[col] = df[col].fillna(df.groupby('Outcome')[col].transform('median'))
    return df

# 使用示例:处理Glucose和BloodPressure两个特征
columns_to_fix = ['Glucose', 'BloodPressure']
# 假设你的数据集是df,替换后赋值回原数据集
df = replace_zeros_with_group_median(df, columns_to_fix)

代码说明

  • df.groupby('Outcome')[col].transform('median'):针对每个Outcome分组计算指定特征的中位数,返回与原数据集行数一致的序列,每一行对应其所在分组的中位数。
  • fillna方法会自动将每个NaN值替换为该行所属分组的中位数,确保填充值符合分组内的数据分布。
  • 函数支持批量传入多个特征列,一次性完成所有需要处理的特征的填充操作。

验证方法

可以通过以下代码检查填充结果是否正确:

# 查看Outcome=0组Glucose的中位数
print(df[df['Outcome'] == 0]['Glucose'].median())
# 查看填充后是否还有NaN值
print(df[columns_to_fix].isna().sum())

内容的提问来源于stack exchange,提问作者Shrinivas Vishnupurikar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 01:57:35