如何用单条awk命令匹配第34列中Sweden的各类大小写变体
优化方案
你原来的写法需要对6.5亿行的文件做6次全量扫描,磁盘IO开销是单命令的6倍,并行跑还会导致进程争抢磁盘IO,机械硬盘场景下性能损失尤其明显,用单条awk单次扫描文件即可覆盖所有匹配规则,性能提升非常显著。
匹配逻辑说明
你原有6条命令的匹配规则可以归为两类:
- 第34列包含任意大小写形式的
Sweden子串 - 第34列整值为任意大小写形式的瑞典两字母国家代码
se
推荐命令
版本1:GNU Awk 写法(绝大多数Linux发行版默认awk适用,写法最简洁)
利用GNU Awk内置的IGNORECASE变量开启大小写不敏感匹配,单条命令覆盖所有场景:
awk -F\" 'BEGIN{IGNORECASE=1} $34 ~ /sweden/ || $34 ~ /^se$/' "$ipp" > sweden.csv
版本2:全兼容写法(适配所有awk版本,无环境依赖)
通过tolower()函数把第34列统一转为全小写后做匹配,兼容性拉满,还能覆盖你原有命令没覆盖到的混合大小写场景(比如sWeDen、sE这类原有命令漏匹配的写法):
awk -F\" '{c=tolower($34)} c ~ /sweden/ || c == "se"' "$ipp" > sweden.csv
注意事项
- 不要加
&把进程放后台,单进程顺序读磁盘的效率远高于多进程争抢IO - 把原来的追加写入
>>换成单次重定向>即可,避免历史运行的残留数据混进结果文件,也省掉了多次打开关闭文件的开销 - 以上命令的匹配范围比你原有6条命令更全,不会漏过任何大小写变体的匹配值
内容的提问来源于stack exchange,提问作者Amit Singh
相关产品推荐
相关产品推荐

