哪里可查询存在多种Unicode表示的同形汉字对应关系公开数据库?
问题说明
部分汉字存在多种Unicode表示形式。比如“金”字有两个渲染显示效果、语义完全一致的版本,但二者底层Unicode编码存在差异,分别对应码点U+91D1和U+F90A,现有Unicode查询类站点已经收录了二者的关联,U+F90A的详情页会直接指向U+91D1的编码说明页面。
核心问题:是否存在公开数据库,可查询这类显示效果、语义完全相同但Unicode编码不同的字符之间的对应关系?
可直接使用的公开数据源
- Unicode官方发布的字符等价性映射表:这是最权威的核心数据源。Unicode标准本身就定义了规范等价、兼容等价两类字符等价规则,你提到的这类同形异码CJK汉字(包括落在CJK兼容表意文字区的字符,比如U+F90A这类为兼容旧编码收录的字符)都在该映射表中有明确记录,表内会直接标注每个非标准码点对应的规范标准码点,官方原始数据文件完全公开,可下载后本地部署查询。
- CJK统一表意文字专项映射数据集:专门针对汉字场景整理的对应关系库,除了基础的兼容区到标准区的映射,还覆盖了不同地区用字标准中实际无显示、语义差异的异码字符对应关系,数据完全公开可获取。
- 主流操作系统/编程语言内置的Unicode归一化配套数据集:做Unicode NFC/NFKC归一化处理时依赖的字符映射库,就是基于官方等价标准整理的可直接调用的数据集,本身公开可查,覆盖了绝大多数日常使用场景下的同形异码字符对应关系,不需要额外找第三方数据源就能调用。
小提示:类似U+F90A这类落在CJK兼容表意文字区的汉字,本身就是为了兼容历史旧编码标准才被收录进Unicode的,所有这类兼容区的汉字,在官方等价映射表中都能找到对应的CJK统一表意文字区的标准码点。
内容的提问来源于stack exchange,提问作者Tim Mak
相关产品推荐
相关产品推荐

