如何用grep筛选含至少3次4位以上重复字符序列的行
grep匹配规则问题排查与修正
原命令存在的问题
你当前编写的grep '^.*\(....\)*\1*\1*' file.name命令不符合预期,核心错误有3点:
- 捕获组后的
*量词逻辑错误:\(....\)*表示长度为4的序列重复0次或多次,会导致捕获组匹配到空内容,无法固定捕获单个长度为4的连续字符序列的规则 - 反向引用后的
*量词完全不满足匹配要求:\1*表示反向引用的内容重复0次或多次,等于你要求的「序列至少出现3次」规则完全失效,哪怕该序列一次都没出现也能匹配,最终会匹配所有行 - 缺失序列中间的任意字符匹配逻辑:重复出现的序列中间可以存在其他字符,你没有加
.*匹配这部分内容,即使去掉错误量词也无法匹配到间隔出现的目标序列
修正方案
符合需求的命令如下:
基础正则版本
grep '\(....\).*\1.*\1' file.name
扩展正则版本(可读性更高)
grep -E '(.{4}).*\1.*\1' file.name
逻辑说明
- 首先用
\(....\)(或扩展正则的(.{4}))捕获一个长度为4的连续字符序列 - 后续的
.*\1表示中间隔任意字符后,再出现一次捕获到的序列,写两次就代表总共至少出现3次,完全符合你的筛选规则 - 上述命令执行后会刚好输出你期望的两行结果
内容的提问来源于stack exchange,提问作者DOS HASAN
相关产品推荐
相关产品推荐

