运行Python脚本时内核崩溃自动重启,是否因450MB的RData文件导致?
内核崩溃原因分析与解决建议
一、450MB RData文件是内核崩溃的高概率原因
RData是R的序列化文件,存储的对象通过pyreadr加载并转换为pandas DataFrame时,内存占用会大幅膨胀——通常是原文件大小的2-5倍甚至更高。450MB的原始文件加载后,实际内存占用可能突破2GB,若你的运行环境(比如Jupyter默认内核)内存分配不足,就会触发内存不足(OOM),导致内核崩溃重启。
二、脚本本身的错误会加剧内存问题
你当前的代码存在一个关键问题:pyreadr.read_r()返回的是字典类型(键是RData中的对象名,值是对应的DataFrame),而你直接用pd.concat([df_FaultFree, df_Faulty])拼接字典,这不仅无法得到预期的合并结果,还会产生不必要的内存开销,进一步加剧内存压力。
三、解决步骤
修正RData读取方式
先查看RData中的对象名,再提取对应的DataFrame:import pyreadr # 读取第一个文件并查看对象名 df_FaultFree_dict = pyreadr.read_r('TEP_FaultFree_Training.RData') print(df_FaultFree_dict.keys()) # 输出RData内的所有对象名称 # 提取目标DataFrame(替换为实际的对象名) df_FaultFree = df_FaultFree_dict['目标对象名'] # 对故障数据文件执行同样操作 df_Faulty_dict = pyreadr.read_r('TEP_Faulty_Training.RData') df_Faulty = df_Faulty_dict['目标对象名']降低内存占用
- 加载后立即筛选所需数据:比如先加载
df_FaultFree,筛选出faultNumber==0的行后,再加载df_Faulty,避免同时占用两个大文件的内存。 - 优化数据类型:将pandas列的类型转换为更节省内存的格式,例如:
# 将float64类型转为float32 df_FaultFree = df_FaultFree.astype({col: 'float32' for col in df_FaultFree.select_dtypes('float64').columns}) - 只加载需要的列:如果不需要全部列,可以在读取时指定(部分版本的
pyreadr支持cols参数),或者加载后删除无关列。
- 加载后立即筛选所需数据:比如先加载
检查并扩展内存
- 运行前查看当前可用内存:
import psutil mem_info = psutil.virtual_memory() print(f"可用内存: {mem_info.available / 1024**3:.2f} GB") - 若使用Jupyter,可通过修改内核启动参数增加内存分配(具体方式取决于你的环境,比如Anaconda可调整内核配置文件)。
- 运行前查看当前可用内存:
内容的提问来源于stack exchange,提问作者Kakashi
相关产品推荐
相关产品推荐

