超大矩阵计算相关矩阵时rcorr函数报错的解决方案
报错核心原因
你调用rcorr(t(M1))时,转置后的矩阵列数为55422(对应rcorr判定的变量数p),p*p的计算结果为3071698084,超过R中32位整数的最大上限2147483647,触发整数溢出生成NA,导致后续申请存储相关矩阵的向量时失败。
可行解决方案
分场景选择对应方案:
场景1:你实际需要计算原矩阵888个列变量的相关
属于输入参数错误,rcorr默认按列计算变量间的相关系数,无需对原矩阵转置,直接运行以下代码即可:
此时变量数p为888,p*p远小于整数上限,不会触发溢出问题。cor <- rcorr(M1, type = "pearson")场景2:你确实需要计算原矩阵55422个行变量的相关
首先注意完整的55422×55422相关矩阵约占24GB内存,需要确认你的设备内存足够支撑,再选择以下方案:- 方案1:换用无整数溢出问题的相关计算函数
base R自带的cor()函数、WGCNA包的corAndPvalue()函数都适配大维度相关计算,不会触发本次的整数溢出问题,示例代码:# 仅计算相关系数 cor_mat <- cor(t(M1), method = "pearson") # 需要同时计算p值可使用WGCNA包的函数 library(WGCNA) cor_res <- corAndPvalue(t(M1), method = "pearson") - 方案2:自定义修改rcorr源码规避溢出
如果你必须使用rcorr的计算逻辑,可以提取Hmisc包中rcorr的源码,将内部p*p的计算修改为as.numeric(p)*as.numeric(p),重新定义自定义函数后调用即可。
- 方案1:换用无整数溢出问题的相关计算函数
场景3:不需要完整相关矩阵,仅需保留满足阈值的相关对
可以采用分块计算的方式,将55422个行变量拆分为多个小分块,逐对计算分块间的相关系数,仅保留符合阈值要求的结果,既可以规避溢出问题,也能大幅降低内存占用。
内容的提问来源于stack exchange,提问作者11thal11thal
相关产品推荐
相关产品推荐

