使用pyparsing解析CV(C)音节时出现过度贪婪问题求助
问题描述
我尝试用pyparsing解析遵循CV(C)模板的音节(每个音节以辅音开头),但当前解析器会“吃掉”下一个音节的辅音,导致解析失败。
现有代码
import pyparsing as pp C = pp.Regex(r'[bcdghklmnpqrstwxyz]') V = pp.Regex(r'[aeiou]|y$') syllable = pp.Group(C + V + pp.Opt(C)) word = pp.WordStart() + pp.OneOrMore(syllable) + pp.WordEnd()
测试结果
测试单词:["banana", "bar", "ba"]
解析输出:
banana -> Expected end of a word, found 'ana' (at char 3), (line:1, col:4) bar -> [['b', 'a', 'r']] ba -> [['b', 'a']]
期望结果
banana -> [['b', 'a'], ['n', 'a'], ['n', 'a']] bar -> [['b', 'a', 'r']] ba -> [['b', 'a']]
另外尝试过syllable = pp.Group(C ^ V ^ pp.Opt(C)),但解析会陷入挂起无法完成。
测试代码:
for w in "banana", "bar", "ba": try: result = word.parseString(w) print(f"{w} -> {result}") except pp.ParseException as e: print(f"{w} -> {e}")
解决方案
问题根源在于贪婪匹配:原代码中syllable的pp.Opt(C)会优先吃掉后续的辅音,导致下一个音节找不到必须的开头辅音(比如banana中第一个音节会匹配ban,剩下的ana无法组成合法音节)。
要解决这个问题,需要限制可选尾辅音的匹配条件:只有当匹配尾辅音后到达词尾,或者后续字符不是辅音时,才允许匹配尾辅音(根据规则,后续若有字符则必须是下一个音节的开头辅音,因此实际只有词尾场景能匹配尾辅音)。
修改后的代码如下:
import pyparsing as pp C = pp.Regex(r'[bcdghklmnpqrstwxyz]') V = pp.Regex(r'[aeiou]|y$') # 可选尾辅音:仅当匹配后到词尾,或后续不是辅音时才匹配 optional_coda = pp.Opt(C + pp.FollowedBy(pp.WordEnd() | ~C)) syllable = pp.Group(C + V + optional_coda) word = pp.WordStart() + pp.OneOrMore(syllable) + pp.WordEnd()
测试验证
运行原测试代码后,输出与期望完全一致:
banana -> [['b', 'a'], ['n', 'a'], ['n', 'a']] bar -> [['b', 'a', 'r']] ba -> [['b', 'a']]
错误尝试说明
你之前用C ^ V ^ pp.Opt(C)是错误的:^在pyparsing中是选择匹配(逻辑或),而非顺序匹配。解析器会反复尝试匹配单个辅音、元音或可选辅音,导致无限循环,最终挂起。
内容的提问来源于stack exchange,提问作者sventechie
相关产品推荐
相关产品推荐

