词法分析器开发中递归BNF标识符规则如何转写为正则表达式
问题原因分析
你遇到的报错是因为正则表达式的命名片段不支持自递归引用,你在id的规则里直接使用{id}本身,就会触发循环引用错误。
你给出的递归BNF本质属于正则文法范畴,不需要递归就能等价转换为非递归的正则表达式。
等价正则转换方案
你给出的<id> BNF规则可以拆解为两个约束:
- 首字符只能是英文字母或者下划线
_ - 首字符之后的剩余部分可以是0个或多个英文字母、数字(注:按你给出的BNF,后续字符不允许出现下划线,若需要支持下划线在任意位置可参考后续扩展说明)
第一步:新增基础字符片段定义
在你已有的定义基础上,新增后续允许的字符集合定义:
digit=[0-9] integer={digit}+ letter=[a-zA-Z] # 新增:标识符后续位置允许的字符,按给出BNF仅包含字母、数字 id_char={letter}|{digit}
第二步:编写非递归的id正则规则
id=({letter}|_){id_char}*
规则匹配验证
这个正则完全覆盖BNF的所有合法情况:
- 当
{id_char}*匹配0次时,对应BNF的前两个分支:单个字母、单个下划线 - 当
{id_char}*匹配1次或多次时,对应BNF的后两个递归分支:在已有合法id后追加字母或数字
扩展说明(常见编程语言标识符适配)
如果你的场景需要支持下划线出现在标识符的任意位置(比如user_name这类命名),只需要修改id_char的定义即可,对应BNF也需要补充<id> ::= <id> "_"的分支:
# 允许后续位置出现下划线的版本 id_char={letter}|{digit}|_
额外注意事项
在lexer的规则排序中,需要把关键字的匹配规则放在标识符规则之前,否则if、for这类关键字会被优先识别为普通标识符。
内容的提问来源于stack exchange,提问作者komal khan
相关产品推荐
相关产品推荐

