You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

替换字符串为整数后Pandas的df.describe()未计算对应列的问题排查

问题描述

我正在开展一项将心理测试与患者滥用处方药概率关联的项目,原数据集示例如下:

ID Age Sex Neuro Aggro Agree Impulse Cocaine Crack ... Legal MJ
1   25  M   9      4     1      5      CL1    CL2  ...  CL1  CL3
2   28  F   4      5     5      8      CL0    CL1  ...  CL3  CL3

我希望去除字符串中的CL保留数字,执行了如下代码:

df=df.replace('CL0', 0, regex= True)

处理后数据集显示为整数,但运行df.describe()时仅展示未修改的列;使用df.describe(include='all')时,修改列仅显示count、unique、top、freq,均值、标准差等统计量为空。已确认修改列无字符串,均为整数,请问如何让df.describe()能计算这些列的统计量?

解决方案

问题核心是修改后的列数据类型仍为object(字符串类型)——哪怕显示的是数字,Pandas还是会将其归类为非数值型列,因此describe()不会计算均值、标准差等统计量。按以下步骤修复:

  1. 批量清除所有CL前缀
    不要单独替换CL0,用正则表达式批量去掉所有列中的CL字符串:

    df = df.replace(r'CL', '', regex=True)
    
  2. 转换为数值类型
    将目标列转换为整数类型,可指定列名批量处理:

    # 替换成你实际需要转换的列名列表
    target_cols = ['Cocaine', 'Crack', 'Legal', 'MJ']
    df[target_cols] = df[target_cols].astype(int)
    

    若不确定哪些列需要转换,也可以自动遍历尝试转换:

    import pandas as pd
    
    for col in df.columns:
        try:
            df[col] = pd.to_numeric(df[col])
        except ValueError:
            # 无法转换的列(如Sex)直接跳过
            pass
    
  3. 验证并测试
    用df.dtypes查看列类型,确认目标列已变为int64或float64,此时运行df.describe()就能看到这些列的完整统计量了。

内容的提问来源于stack exchange,提问作者Ven

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.30 20:09:23