Pandas中使用describe()时数据类型未改变的问题咨询
问题解析:整数列
describe()返回浮点型结果的原因 你遇到的这个情况其实是Pandas的设计逻辑导致的,咱们一步步拆解来看:
还原操作与现象
首先是你的初始代码及输出:
import pandas as pd dict = {'A':[10.0, 9.10, 8.93, 9.5], 'B':[3.0, 7.45, 5.6, 10.3], 'C':[5.32, 4.30, 8.0, 9.8]} df = pd.DataFrame(dict) print(df['A'].describe())
输出:
count 4.000000 mean 9.382500 std 0.475981 min 8.930000 25% 9.057500 50% 9.300000 75% 9.625000 max 10.000000 Name: A, dtype: float64
接着是转换为int32后的操作与输出:
df['A'] = df['A'].round(0).astype('int32') print(df['A'].describe())
输出:
count 4.00000 mean 9.50000 std 0.57735 min 9.00000 25% 9.00000 50% 9.50000 75% 10.00000 max 10.00000 Name: A, dtype: float64
核心原因解释
虽然你已经通过astype('int32')把df['A']的真实类型转为整数(可以用df.dtypes确认),但describe()方法返回的统计结果会统一用浮点型展示,原因在于:
- 分位数计算(比如25%、50%、75%)很可能产生非整数结果,比如你的例子里50%分位数是9.5,这个值无法用整数类型存储。
- Pandas为了保证所有统计指标都能完整展示,不会因为类型限制丢失精度,会自动将整个统计结果的 dtype 提升为浮点型。
验证列的真实类型
你可以通过以下代码确认列的实际类型确实是整数:
print(df.dtypes) # 输出: # A int32 # B float64 # C float64 # dtype: object print(type(df['A'].values[0])) # 输出:<class 'numpy.int32'>
简单来说,列本身确实是整数类型,但describe()的输出为了兼容分位数的非整数结果,统一用浮点型呈现,这是Pandas的合理设计哦~
内容的提问来源于stack exchange,提问作者jcf
相关产品推荐
相关产品推荐

