如何遍历无表头单列CSV并统计内容在压缩文件中的出现次数
遍历单列CSV并统计关键词在压缩JSON文件中的出现次数
最终可用命令
while IFS=',' read -r column; do count=$(zgrep -o "$column" *json.gz | wc -l) echo "$count" done < file.csv
命令细节拆解
读取CSV行内容:
while IFS=',' read -r columnIFS=','指定逗号为字段分隔符,能自动处理CSV里行尾带逗号的情况(比如foo,会被读取为foo)-r参数避免读取时转义反斜杠,保证关键词内容原样保留
统计关键词出现次数:
zgrep -o "$column" *json.gz | wc -lzgrep直接操作gzip压缩文件,省去手动zcat的步骤-o参数只输出匹配到的关键词本身,确保一行中多次出现同一个关键词时,能被统计为多次(如果不加-o,整行只会被算1次)wc -l统计匹配结果的行数,也就是关键词的出现次数
输出结果:
echo "$count"只输出统计的次数,完全符合期望的输出格式
示例验证
假设你的file.csv内容为:
foo, bar
当foo在所有json.gz文件中出现20次,bar出现30次时,命令会输出:
20 30
原逻辑的问题说明
你最初写的for i in file.csv是把文件名file.csv当成循环变量,不会遍历文件里的每一行内容,所以无法正确传递每行的关键词到后续命令中,而while read循环是Shell中处理文件行内容的标准方法。
内容的提问来源于stack exchange,提问作者Wiseface
相关产品推荐
相关产品推荐

