如何判断外观相同但编码不同的两个Ruby字符串是否等价?
解决Unicode字符串视觉相同但比对失败的问题
问题根源:Unicode的两种等价表示
你遇到的是Unicode规范化差异,属于多字节编码范畴:
- 网页端的
á是预组合字符(NFC):用单个Unicode码点U+00E1表示,视觉上是一个整体字符。 - 下载文件名里的
á是分解字符(NFD):由基础字符a(U+0061)加上独立的组合重音标记◌́(U+0301)组成,两者视觉完全一致,但底层码点序列不同,直接比对自然不相等。
macOS的文件系统(APFS/HFS+)默认会将文件名转换为NFD形式,而Google Sheets网页端存储标签名用的是NFC,这就是差异的来源。
解决方案:统一规范化形式后比对
Ruby内置了unicode_normalize方法,可以将字符串转换为统一的规范化形式,之后再做相等性校验:
代码示例
# 网页端获取的字符串(NFC) s1 = "Kodály" # 本地文件名截取的字符串(NFD) s2 = "Kodály" # 转换为NFC形式后比对 puts s1.unicode_normalize(:nfc) == s2.unicode_normalize(:nfc) # 输出 true # 或者转换为NFD形式 puts s1.unicode_normalize(:nfd) == s2.unicode_normalize(:nfd) # 输出 true
参数说明
:nfc:将字符串转换为预组合形式,把分解的基础字符+标记合并为单个预组合码点:nfd:将字符串转换为分解形式,把预组合字符拆分为基础字符+标记
两种方式都能让视觉相同的字符串拥有一致的底层码点序列,从而通过比对。
内容的提问来源于stack exchange,提问作者Max Williams
相关产品推荐
相关产品推荐

