You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Polars内存效率不及Pandas?内存高效预览表格的测试疑问

Pandas vs Polars 内存占用测试结果反常,求排查操作失误?

我需要以内存高效的方式生成用户上传的电子表格文件预览,因此用pytest-memray开展测试。测试代码覆盖CSV和XLSX文件的完整加载、部分加载场景,对比Pandas与Polars的内存占用情况。结果显示,无论是加载3万行的rows.csv还是100万行的bankdataset.xlsx,Pandas的内存效率均优于Polars,即便使用Polars的LazyFrame(pl.scan_csv)也无改善,请问我是否存在操作失误?


可能的操作失误排查方向

  • 内存测试的时机与范围偏差
    使用memray时,需确保精准捕获数据加载的核心阶段。如果测试代码附带了额外操作(如数据转换、打印输出),会干扰内存统计结果。另外,LazyFrame是延迟执行的,若测试中触发了collect()方法,就等同于全量加载,完全抵消了Lazy模式的内存优势——测试LazyFrame时要确保仅停留在扫描阶段,不触发实际数据加载。

  • 数据类型自动推断的差异
    Pandas与Polars的自动类型推断逻辑不同,Polars可能默认将某些列推断为更占内存的类型(比如把整数列设为Int64而非int32,或给字符串列分配更大的默认存储空间)。可以手动指定列类型,给Polars添加dtypes参数强制匹配Pandas的类型后,再重新测试内存占用。

  • XLSX读取引擎的差异
    Pandas读取XLSX默认使用openpyxl或xlrd,Polars则依赖xlsx2csv或自有解析逻辑,不同引擎的内存开销差异明显。可尝试让两者使用相同的底层引擎(比如Polars指定engine="openpyxl"),再对比结果。

  • 部分加载的实现逻辑问题
    若测试部分加载场景(如仅加载前N行),Pandas用nrows参数直接限制读取行数,而Polars若用head(N)或LazyFrame中加limit(N)后执行collect(),需确认是否真的只读取了对应行数的数据,而非先全量加载再截断。可以通过查看Polars读取时的IO日志或监控磁盘读取量来验证。

  • memray的配置未聚焦目标操作
    memray默认会记录所有内存分配,可能将测试框架本身、辅助代码的内存开销计入统计。需配置memray仅捕获pd.read_csv、pl.scan_csv等目标数据加载函数的内存分配,排除无关代码的干扰。


内容的提问来源于stack exchange,提问作者monopoly

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.12 20:27:15