R语言统计每列中值大于5且行名属于指定列表的记录次数
实现代码
步骤1:分别统计x、y列表对应的符合条件的样本计数
# 统计每个样本中,行名属于x且值>5的行数 numX <- colSums(df1[rownames(df1) %in% x, ] > 5) # 统计每个样本中,行名属于y且值>5的行数 numY <- colSums(df1[rownames(df1) %in% y, ] > 5)
步骤2:将统计结果合并到df2
如果df2的行顺序和numX、numY的列名顺序完全对应,可以直接赋值:
df2$x <- numX df2$y <- numY
如果担心顺序不匹配,可以用行名匹配保证准确性:
df2$x <- numX[match(df2$rownames, names(numX))] df2$y <- numY[match(df2$rownames, names(numY))]
原代码错误原因
- 核心错误是把「数值>5」的判断条件错误写到了行筛选逻辑里,错误地将行名字符串和阈值做比较,逻辑完全错位
- 没有对df1内的实际计数值做>5的判断,所以要么返回值的总和,要么返回全局总条数,得不到按样本统计的符合条件的记录数
内容的提问来源于stack exchange,提问作者keenan
相关产品推荐
相关产品推荐

