咨询:我对Unicode标准中Code Unit定义的理解是否正确?
Unicode标准指出:
Code unit:用于处理或交换的、可表示编码文本单元的最小位组合。
Unicode标准在UTF-8编码形式中使用8位Code unit,在UTF-16编码形式中使用16位Code unit,在UTF-32编码形式中使用32位Code unit。
我难以理解上述第一段中Code unit的定义,不确定是因为英语非母语还是遗漏了某些内容。
- 我未找到“编码文本单元”的定义,但猜测其指代code point,是否正确?
- “可表示编码文本单元以用于处理的最小位组合”是否意为“存在至少一个code point可通过该位组合表示的最小位组合”?
我提出这些问题是因为标准中的定义表述让我产生一种误解,即所有code point都可通过该位组合表示(这与UTF-8的1字节Code unit大小矛盾),可能是我对表述理解有误。
内容的提问来源于stack exchange,提问作者nistel
相关产品推荐
相关产品推荐

