拥有200MB CSV数据,保存Pandas DataFrame选何格式最小化体积?
Pandas DataFrame存储格式选择方案
针对你将200MB CSV数据转为DataFrame后存储的需求,结合你实际测试的结果,整理如下:
存储体积最小选择
- 压缩ZIP格式:你实测验证这是存储体积最优的方案。可以直接通过Pandas将DataFrame写入带压缩的ZIP文件,示例代码:
这种方式能显著压缩原始CSV的体积,适合对存储空间要求高的场景。df.to_csv('data.zip', compression='zip')
读写速度最快选择
- Pickle(.pkl)格式:作为Python原生序列化格式,它的读写效率最高,操作简单:
- 写入:
df.to_pickle('data.pkl') - 读取:
pd.read_pickle('data.pkl')
注意:Pickle仅适用于Python生态,跨语言兼容性差,且不同Python版本间可能存在兼容问题。
- 写入:
未测试的高效备选格式
你因依赖问题未尝试的Parquet和Feather,是兼顾体积与速度的优质选择:
- Parquet:列式存储格式,压缩率高,支持跨语言,适合大数据场景,需安装
pyarrow或fastparquet依赖。 - Feather:专为Python/R设计的轻量级二进制格式,读写速度接近Pickle,体积远小于CSV,需安装
pyarrow或feather-format依赖。
内容的提问来源于stack exchange,提问作者optimistic-orange
相关产品推荐
相关产品推荐

