R语言查找大型相关矩阵非对角线含1的列序号的高效方案
原代码问题分析
你原来的代码错误点在于:which(m == 1)返回的是矩阵元素的线性索引,你用m[which(m == 1)]提取后得到的是一维数值向量,对向量调用col()函数自然无法得到正确的列序号,甚至会直接报错。
高效实现方案
方案1:内存可容纳的稠密矩阵场景
不需要修改原矩阵(避免一次全矩阵赋值开销),直接调用which的arr.ind参数直接返回符合条件的坐标,提取列号后去重即可:
# 直接筛选非对角线且值为1的位置,arr.ind返回行列坐标矩阵 pos <- which(m == 1 & row(m) != col(m), arr.ind = TRUE) target_cols <- unique(pos[, "col"])
如果你的矩阵是对称的相关矩阵,还可以只判断上三角区域,运算量直接减半:
pos <- which(m == 1 & upper.tri(m), arr.ind = TRUE) target_cols <- unique(pos[, "col"])
方案2:超大型稀疏矩阵场景
如果矩阵尺寸极大、稀疏度很高(相关矩阵通常符合这个特征),用Matrix包的稀疏矩阵结构可以降低内存占用几个量级,运算速度也会大幅提升:
library(Matrix) # 转换为稀疏矩阵格式,仅存储非0值 m_sparse <- as(m, "sparseMatrix") # 直接从稀疏矩阵的非0值存储区筛选符合条件的位置 target_pos <- m_sparse@i != m_sparse@j & m_sparse@x == 1 target_cols <- unique(m_sparse@j[target_pos] + 1) # 稀疏矩阵索引默认从0开始,加1转为R的1基索引
内容的提问来源于stack exchange,提问作者Amin Shn
相关产品推荐
相关产品推荐

