如何高效处理大CSV文件:过滤非时间列连续重复行(仅留首次)
处理大型CSV连续重复行的高效方案
我有一个大型CSV文件,其中存在连续重复的行——这类行仅第1、2、3、4列(时间相关列)内容不同,后续列完全一致。我希望跳过这类连续重复行,仅保留首次出现的那一行(非连续的重复行无需处理)。
有没有比下面这段代码更高效的实现方式?同时我也不想费力地硬编码判断条件(比如当列数超过9时就得修改代码):
awk -F"," -v OFS="," 'p[5]!=$5 || p[6]!=$6 || p[7]!=$7 || p[8]!=$8 || p[9]!=$9 {for (i = 5; i <= 9; i++) {p[i] = $i}; print $0}' file_path
示例输入
a,z,k,d,5,6,7,8,9 b,x,j,d,5,6,7,8,9 c,c,l,e,8,9,1,2,3 d,v,k,r,8,9,1,2,3 e,b,j,e,9,1,2,3,4 f,n,h,t,5,6,7,8,9 g,m,g,w,6,3,4,5,6 h,a,f,q,4,5,6,7,8 i,s,d,w,4,5,6,7,8 i,s,d,w,4,5,6,7,8
期望输出
a,z,k,d,5,6,7,8,9 c,c,l,e,8,9,1,2,3 e,b,j,e,9,1,2,3,4 f,n,h,t,5,6,7,8,9 g,m,g,w,6,3,4,5,6 h,a,f,q,4,5,6,7,8
优化方案
可以用以下awk命令实现,无需硬编码列数,效率也更高:
awk -F',' -v OFS=',' '{ key = "" for (i=5; i<=NF; i++) key = key $i SUBSEP if (key != prev_key) { print prev_key = key } }' file_path
方案说明
- 无需硬编码列数:通过awk内置变量
NF(当前行的总列数)动态遍历第5列到最后一列,不管CSV有多少列都能自动适配。 - 高效低内存:用awk内置的
SUBSEP(不可打印的分隔符,不会和CSV内容冲突)拼接后续列作为判断重复的唯一键,仅保存上一行的键值,内存占用极低,适合处理GB级的大型文件。 - 逻辑简洁:只需比较当前行的后续列键与上一行的键是否一致,不一致就打印当前行并更新键值,完美匹配“仅保留首次出现的连续重复行”需求。
如果追求更精简的写法,也可以压缩成一行:
awk -F, -v OFS=,'{key="";for(i=5;i<=NF;i++)key=key$iSUBSEP;if(key!=prev_key){print;prev_key=key}}' file_path
内容的提问来源于stack exchange,提问作者Shuri2060
相关产品推荐
相关产品推荐

