为何UTF-8仅用单字节编码128个字符而非256个?
为什么UTF-8单字节只编码128个字符而非256个?
核心原因是兼容ASCII编码,同时要实现多字节编码的无歧义解析:
首先,ASCII是早期最通用的单字节编码,本身就定义了128个字符(0x00到0x7F)。UTF-8的设计目标之一就是让所有ASCII文本无需任何转换,就能直接被UTF-8解析器正确识别,所以单字节范围完全复用了ASCII的编码区间,也就是仅用128个字符。
其次,UTF-8需要用单字节的高位来区分单字节和多字节字符:单字节字符的最高位固定为
0,而多字节字符的第一个字节会以连续的1开头(比如双字节是110xxxxx,三字节是1110xxxx),后续的字节则统一以10开头。如果把单字节的256个位置都用满,那些最高位为1的字节就无法作为多字节编码的标识位,解析器会无法区分一个字节是独立的单字节字符,还是多字节序列的一部分,从而导致解析混乱。
这种设计既保证了对旧有ASCII系统的兼容性,又实现了多字节编码的无歧义解析,也是UTF-8能成为主流编码的关键原因之一。
内容的提问来源于stack exchange,提问作者Piet Pro
相关产品推荐
相关产品推荐

