在ICU正则中条件性使用(?<=^)的技术问题咨询
问题描述
我有一段多行文本,每行开头要么是数字、普通分数(如1/2这类格式),要么是普通字符。想用ICU正则变体匹配所有不以数字或普通分数开头的行首空白,但试了几个正则都没达到预期效果,想知道问题出在哪。
尝试过的正则如下:
^[a-zA-Z](?<=^)\s* (?<=\R\s*)[a-zA-Z]\s*\D\s* \s+(?=\n(?!(?:\d+ )?\d+\/\d)) ^[a-zA-Z](?<=^)\s*
问题分析与正确正则
你之前的正则存在几个核心问题:
- 逻辑顺序颠倒:比如
^[a-zA-Z](?<=^)\s*先匹配行首字母,再用反向断言回头看行首,完全不符合“匹配行首空白”的目标; - 断言条件覆盖不全:没有同时排除“数字开头”和“分数开头”的情况,部分正则只针对分数做了排除,漏了纯数字开头的行;
- 匹配目标偏离:有的正则错误地去匹配字母或其他字符,而非聚焦在“行首空白”上。
针对需求,正确的ICU正则应该是:
(?<=^)\s+(?=(?!\d+\/\d)\D)
正则解释
(?<=^):反向断言,确保当前位置处于行首(ICU原生支持行首位置的反向断言);\s+:匹配1个及以上的行首空白字符(如果要匹配0个或多个,可把+改成*,但通常行首空白是指有实际空白的情况);(?=(?!\d+\/\d)\D):正向嵌套断言,先通过(?!\d+\/\d)排除“普通分数开头”的情况,再用\D确保后续字符是非数字(排除纯数字开头的行),最终只匹配普通字符开头的行的行首空白。
如果需要处理跨行的情况,记得开启ICU正则的多行模式(m修饰符),让^匹配每一行的行首。
内容的提问来源于stack exchange,提问作者jeff
相关产品推荐
相关产品推荐

