如何提取两个CSV文件的非共有数据用于EFA与CFA分析
提取CSV中与另一文件无重复的非共有数据方法
做EFA、CFA分析拆分数据集时,为保证随机拆分的有效性,需避免分析数据交叉复用,筛选出未在另一分析环节使用过的独立数据,可按以下方案实现:
使用R语言dplyr包的anti_join()函数即可快速完成筛选,该函数会保留左表中所有在右表无匹配项的记录,完全匹配提取非重复独立数据的需求。
操作步骤:
- 提前将两份CSV文件读入R环境,存储为两个数据框对象
- 运行筛选代码,注意替换参数为实际业务内容:
library(dplyr) # 替换file_one为待提取数据的源数据框,file_two为用于比对排除重复的参考数据框 # by参数传入用于判定数据重复的对应列名 Usage <- anti_join(file_one, file_two, by = "用于匹配去重的列名")
- 将筛选结果导出为CSV文件即可直接使用:
write.csv(Usage, "筛选完成的独立数据.csv", row.names = FALSE)
内容的提问来源于stack exchange,提问作者ara
相关产品推荐
相关产品推荐

