You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

词法分析器开发中递归BNF标识符规则如何转写为正则表达式

问题原因分析

你遇到的报错是因为正则表达式的命名片段不支持自递归引用,你在id的规则里直接使用{id}本身,就会触发循环引用错误。
你给出的递归BNF本质属于正则文法范畴,不需要递归就能等价转换为非递归的正则表达式。

等价正则转换方案

你给出的<id> BNF规则可以拆解为两个约束:

  1. 首字符只能是英文字母或者下划线_
  2. 首字符之后的剩余部分可以是0个或多个英文字母、数字(注:按你给出的BNF,后续字符不允许出现下划线,若需要支持下划线在任意位置可参考后续扩展说明)

第一步:新增基础字符片段定义

在你已有的定义基础上,新增后续允许的字符集合定义:

digit=[0-9]
integer={digit}+
letter=[a-zA-Z]
# 新增:标识符后续位置允许的字符,按给出BNF仅包含字母、数字
id_char={letter}|{digit}

第二步:编写非递归的id正则规则

id=({letter}|_){id_char}*
规则匹配验证

这个正则完全覆盖BNF的所有合法情况:

  • 当{id_char}*匹配0次时,对应BNF的前两个分支:单个字母、单个下划线
  • 当{id_char}*匹配1次或多次时,对应BNF的后两个递归分支:在已有合法id后追加字母或数字
扩展说明(常见编程语言标识符适配)

如果你的场景需要支持下划线出现在标识符的任意位置(比如user_name这类命名),只需要修改id_char的定义即可,对应BNF也需要补充<id> ::= <id> "_"的分支:

# 允许后续位置出现下划线的版本
id_char={letter}|{digit}|_
额外注意事项

在lexer的规则排序中,需要把关键字的匹配规则放在标识符规则之前,否则if、for这类关键字会被优先识别为普通标识符。


内容的提问来源于stack exchange,提问作者komal khan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 19:15:00