You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas计算float16列均值/std返回NaN,np.mean(values)正常的排查求助

问题排查与解决方法

核心原因

你的问题是float16数据类型的求和溢出导致的:

  • float16的最大值仅为65504,800万行的2.289062求和后(≈1831万)远超过这个阈值,累积求和时会溢出为inf,最终pandas的mean()计算返回NaN。
  • 而np.mean(df[col].values)会自动将数组提升为更高精度的 dtype(如float64)进行计算,避免了溢出,因此能得到正常结果。

排查步骤

  1. 确认列中是否存在无穷值(isna()/isnull()无法识别inf):
    import numpy as np
    print(df['col1'].isin([np.inf, -np.inf]).sum())
    
    如果结果不为0,说明存在inf值,需先替换为合理值。
  2. 验证求和溢出:
    print(df['col1'].sum())  # 若返回inf,说明确实是溢出问题
    

解决方法

方法1:计算均值时指定高精度dtype

直接在pandas的mean()方法中强制使用更高精度计算:

df['col1'].mean(dtype='float64')

方法2:先转换列的 dtype 再计算

将float16列转换为float32或float64后再求均值:

df['col1'].astype('float64').mean()

方法3:使用numpy的mean并保证精度

保持numpy调用逻辑,同时确保计算精度:

np.mean(df['col1'].astype('float64'))

版本说明

你使用的Pandas 1.3.4在处理float16大样本求和时,默认不会自动提升 dtype;若无法升级版本,上述方法可直接解决问题。

内容的提问来源于stack exchange,提问作者Python coder

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.16 13:35:31