You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

拥有200MB CSV数据,保存Pandas DataFrame选何格式最小化体积?

Pandas DataFrame存储格式选择方案

针对你将200MB CSV数据转为DataFrame后存储的需求,结合你实际测试的结果,整理如下:

存储体积最小选择

  • 压缩ZIP格式:你实测验证这是存储体积最优的方案。可以直接通过Pandas将DataFrame写入带压缩的ZIP文件,示例代码:
    df.to_csv('data.zip', compression='zip')
    
    这种方式能显著压缩原始CSV的体积,适合对存储空间要求高的场景。

读写速度最快选择

  • Pickle(.pkl)格式:作为Python原生序列化格式,它的读写效率最高,操作简单:
    • 写入:df.to_pickle('data.pkl')
    • 读取:pd.read_pickle('data.pkl')
      注意:Pickle仅适用于Python生态,跨语言兼容性差,且不同Python版本间可能存在兼容问题。

未测试的高效备选格式

你因依赖问题未尝试的Parquet和Feather,是兼顾体积与速度的优质选择:

  • Parquet:列式存储格式,压缩率高,支持跨语言,适合大数据场景,需安装pyarrow或fastparquet依赖。
  • Feather:专为Python/R设计的轻量级二进制格式,读写速度接近Pickle,体积远小于CSV,需安装pyarrow或feather-format依赖。

内容的提问来源于stack exchange,提问作者optimistic-orange

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 18:01:18