You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何提取两个CSV文件的非共有数据用于EFA与CFA分析

提取CSV中与另一文件无重复的非共有数据方法

做EFA、CFA分析拆分数据集时,为保证随机拆分的有效性,需避免分析数据交叉复用,筛选出未在另一分析环节使用过的独立数据,可按以下方案实现:

使用R语言dplyr包的anti_join()函数即可快速完成筛选,该函数会保留左表中所有在右表无匹配项的记录,完全匹配提取非重复独立数据的需求。

操作步骤:

  • 提前将两份CSV文件读入R环境,存储为两个数据框对象
  • 运行筛选代码,注意替换参数为实际业务内容:
library(dplyr)
# 替换file_one为待提取数据的源数据框,file_two为用于比对排除重复的参考数据框
# by参数传入用于判定数据重复的对应列名
Usage <- anti_join(file_one, file_two, by = "用于匹配去重的列名")
  • 将筛选结果导出为CSV文件即可直接使用:
write.csv(Usage, "筛选完成的独立数据.csv", row.names = FALSE)

内容的提问来源于stack exchange,提问作者ara

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.28 15:48:16