You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

StorNex(cvfs)文件系统中numpy.load存在2GB内存开销问题排查

为何StorNex(cvfs)文件系统会导致numpy.load产生2GB固定内存开销?

测试背景

我原本认为numpy.load()会直接将数组数据写入内存,但使用memray和mprof进行内存分析后,结果与预期不符:

  • 加载的数组大小为2GB(形状(268435451,),数据类型float64),预期峰值内存为2GB或最多4GB(存在缓冲的情况)
  • 分析结果显示内存时序异常:加载完成后等待1秒期间内存仍在增长
  • 测试采样间隔:mprof 0.001秒、memray 0.1毫秒

测试代码如下:

import os
import time
from datetime import datetime as dt

import memray
import numpy as np

def main():
    time.sleep(1)
    print(dt.now())
    m_ = np.load(
        os.path.join(os.path.expanduser('~'), 'test_data/max_compression_chunk.npy'),
        mmap_mode=None,
    )
    print(dt.now())
    time.sleep(1)
    print(dt.now())

if __name__ == "__main__":
    with memray.Tracker("memray_test.bin", memory_interval_ms=0.1, follow_fork=True, native_traces=True):
        main()

排查过程

  1. 环境信息确认

    • 测试环境:Rocky Linux 8.10 (Green Obsidian)
    • 版本:CPython 3.13.2,Numpy 2.2.4
  2. 对比numpy.fromfile测试
    测试发现numpy.fromfile()的内存表现符合预期,但memray与mprof的结果存在差异。

  3. 环境重置验证
    重新安装环境并创建新测试数组后,内存时序恢复正常,但仍疑问峰值内存是否应为数组大小的两倍(4GB)。

  4. 文件系统定位
    经测试确认,内存开销与文件大小无关,仅取决于加载文件所在的文件系统:

    • 在BeeGFS中加载时,内存表现符合预期
    • 在cvfs中加载时,会产生约2GB的固定内存开销,且该开销不随文件大小增加而变化

核心结论

  • 最初推测numpy.load()峰值内存占用翻倍
  • 经多轮测试验证,底层StorNex(cvfs)文件系统会产生与文件大小无关的2GB固定内存开销

寻求技术解析:为何StorNex(cvfs)文件系统会导致numpy.load()出现这种固定内存开销?

内容的提问来源于stack exchange,提问作者Helmut

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.13 06:30:07