You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

运行Python脚本时内核崩溃自动重启,是否因450MB的RData文件导致?

内核崩溃原因分析与解决建议

一、450MB RData文件是内核崩溃的高概率原因

RData是R的序列化文件,存储的对象通过pyreadr加载并转换为pandas DataFrame时,内存占用会大幅膨胀——通常是原文件大小的2-5倍甚至更高。450MB的原始文件加载后,实际内存占用可能突破2GB,若你的运行环境(比如Jupyter默认内核)内存分配不足,就会触发内存不足(OOM),导致内核崩溃重启。

二、脚本本身的错误会加剧内存问题

你当前的代码存在一个关键问题:pyreadr.read_r()返回的是字典类型(键是RData中的对象名,值是对应的DataFrame),而你直接用pd.concat([df_FaultFree, df_Faulty])拼接字典,这不仅无法得到预期的合并结果,还会产生不必要的内存开销,进一步加剧内存压力。

三、解决步骤

  1. 修正RData读取方式
    先查看RData中的对象名,再提取对应的DataFrame:

    import pyreadr
    # 读取第一个文件并查看对象名
    df_FaultFree_dict = pyreadr.read_r('TEP_FaultFree_Training.RData')
    print(df_FaultFree_dict.keys())  # 输出RData内的所有对象名称
    # 提取目标DataFrame(替换为实际的对象名)
    df_FaultFree = df_FaultFree_dict['目标对象名']
    # 对故障数据文件执行同样操作
    df_Faulty_dict = pyreadr.read_r('TEP_Faulty_Training.RData')
    df_Faulty = df_Faulty_dict['目标对象名']
    
  2. 降低内存占用

    • 加载后立即筛选所需数据:比如先加载df_FaultFree,筛选出faultNumber==0的行后,再加载df_Faulty,避免同时占用两个大文件的内存。
    • 优化数据类型:将pandas列的类型转换为更节省内存的格式,例如:
      # 将float64类型转为float32
      df_FaultFree = df_FaultFree.astype({col: 'float32' for col in df_FaultFree.select_dtypes('float64').columns})
      
    • 只加载需要的列:如果不需要全部列,可以在读取时指定(部分版本的pyreadr支持cols参数),或者加载后删除无关列。
  3. 检查并扩展内存

    • 运行前查看当前可用内存:
      import psutil
      mem_info = psutil.virtual_memory()
      print(f"可用内存: {mem_info.available / 1024**3:.2f} GB")
      
    • 若使用Jupyter,可通过修改内核启动参数增加内存分配(具体方式取决于你的环境,比如Anaconda可调整内核配置文件)。

内容的提问来源于stack exchange,提问作者Kakashi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.06 04:22:46