You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用正则匹配无声调标注的汉语阴平注音

汉语注音阴平音节的正则匹配方案

针对给定的注音字符串:

ㄨㄛˇ ㄍㄤ ㄍㄤ ㄗㄞˋ ㄇㄤˊ

要匹配其中不带ˊ、ˇ、ˋ声调标注的阴平音节(即示例中的ㄍㄤ、ㄍㄤ),可以用以下两种可行的正则方案:

方案一:指定注音字符范围匹配

通过限定Unicode字符范围匹配纯注音内容,结合边界规则确保匹配独立音节:

(?:^| )([ㄅ-ㄩ]+)(?: |$)

规则解释:

  • (?:^| ):匹配字符串开头或空格,作为音节的前分隔边界(非捕获组,不会额外捕获边界内容)
  • [ㄅ-ㄩ]+:匹配一个或多个汉语注音字符,ㄅ到ㄩ的范围覆盖了所有常用注音的声母、韵母
  • (?: |$):匹配空格或字符串结尾,作为音节的后分隔边界

方案二:排除声调符号匹配

直接排除声调符号和空格,精准匹配无标注的纯注音序列:

(?:^| )([^ˊˇˋ ]+)(?: |$)

规则解释:

  • [^ˊˇˋ ]:匹配任何不是ˊ、ˇ、ˋ和空格的字符,直接过滤掉带声调的音节
  • 前后的边界规则和方案一一致,保证匹配的是独立完整的阴平音节

关键注意点

使用时需确保正则引擎开启Unicode模式(比如JavaScript中添加u标志,Python中启用re.UNICODE参数),才能正确识别注音这类Unicode字符。

内容的提问来源于stack exchange,提问作者wyc

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.11 08:50:32