Python序列化float至CSV后以np.float64读取是否会丢失精度?
能否保证Python float写入CSV后用Pandas读取的精度一致?
好问题!咱们一步步拆解来看:
首先明确几个核心底层细节:
- Python里的
float本质就是IEEE 754双精度浮点数,和NumPy的np.float64是完全相同的底层存储格式,两者的精度范围完全一致。 - 当你用
csv.writerow()写入float时,默认会调用Python的str()函数把浮点数转成字符串。而Python的str(float)会输出15-17位有效数字——这个长度刚好能唯一确定对应的双精度浮点数,也就是说,生成的字符串包含了恢复原浮点数所需的全部精确信息。
回到你的例子:some_float = 3 / 5,这个值是0.6,属于十进制有限小数,用双精度浮点数可以精确表示。写入CSV时会被转成字符串"0.6",Pandas读取时把这个字符串转回np.float64,得到的结果和原some_float完全一致,没有任何精度损失。
那如果是像0.1这种无法用二进制浮点数精确表示的数值呢?比如some_float = 0.1,实际存储的是一个近似的双精度值。这时候csv.writerow()写入的字符串会是"0.1"吗?其实Python为了可读性,会输出最短的十进制字符串,而这个字符串转成双精度浮点数时,会精确回到原来的近似值。也就是说,即使是这种近似值,只要CSV里的字符串是Python默认生成的,Pandas读取后也能精确恢复原浮点数的二进制表示,不会引入额外的精度损失。
⚠️ 但要注意一个例外:如果你手动修改了CSV的写入格式(比如用format()限制小数位数为"%.2f"),那写入的字符串就丢失了原浮点数的精确信息,这时候读取回来肯定会有精度损失。但默认情况下,csv模块的行为是安全的。
总结一下:
- 默认使用
csv.writerow()写入Python float,再用pandas.read_csv()读取为np.float64,可以保证读取到的浮点值与写入的完全一致,不会有精度损失。 - 前提是你没有手动修改浮点数的序列化格式(比如截断小数位)。
内容的提问来源于stack exchange,提问作者James Ko
相关产品推荐
相关产品推荐

