You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何遍历无表头单列CSV并统计内容在压缩文件中的出现次数

遍历单列CSV并统计关键词在压缩JSON文件中的出现次数

最终可用命令

while IFS=',' read -r column; do
  count=$(zgrep -o "$column" *json.gz | wc -l)
  echo "$count"
done < file.csv

命令细节拆解

  1. 读取CSV行内容:while IFS=',' read -r column

    • IFS=','指定逗号为字段分隔符,能自动处理CSV里行尾带逗号的情况(比如foo,会被读取为foo)
    • -r参数避免读取时转义反斜杠,保证关键词内容原样保留
  2. 统计关键词出现次数:zgrep -o "$column" *json.gz | wc -l

    • zgrep直接操作gzip压缩文件,省去手动zcat的步骤
    • -o参数只输出匹配到的关键词本身,确保一行中多次出现同一个关键词时,能被统计为多次(如果不加-o,整行只会被算1次)
    • wc -l统计匹配结果的行数,也就是关键词的出现次数
  3. 输出结果:echo "$count"只输出统计的次数,完全符合期望的输出格式

示例验证

假设你的file.csv内容为:

foo,
bar

当foo在所有json.gz文件中出现20次,bar出现30次时,命令会输出:

20
30

原逻辑的问题说明

你最初写的for i in file.csv是把文件名file.csv当成循环变量,不会遍历文件里的每一行内容,所以无法正确传递每行的关键词到后续命令中,而while read循环是Shell中处理文件行内容的标准方法。

内容的提问来源于stack exchange,提问作者Wiseface

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.03 13:55:21