You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Kotlin中遍历包含U+FFFF以上Unicode码点的字符串?

Kotlin遍历含高码点Unicode字符串的拆分问题解决办法

在Kotlin中遍历包含U+FFFF以上Unicode字符的字符串时,这类高码点字符会被拆分成两个代理字符,导致输出不符合预期。比如emoji😀(U+1F600)会被拆成两个单独的代码单元,输出显示为�和对应的代理码点。

示例代码

val s = "Hëllø! € 😀"
for (c in s) {
    println("$c ${c.code}")
}

实际输出

H 72
ë 235
l 108
l 108
ø 248
! 33
  32
€ 8364
  32
� 55357
� 56832

期望输出

H 72
ë 235
l 108
l 108
ø 248
! 33
  32
€ 8364
  32
😀 128512

问题原因

Kotlin的Char类型对应UTF-16编码的单个代码单元,而U+FFFF以上的Unicode字符需要两个UTF-16代码单元(代理对)来表示。直接遍历字符串的Char元素时,会分别拿到这两个代理单元,而不是完整的Unicode码点。

解决办法

方法1:使用codePoints()遍历完整码点

通过String.codePoints()获取字符串的完整Unicode码点流,遍历每个码点并转换为对应的字符输出:

val s = "Hëllø! € 😀"
s.codePoints().forEach { codePoint ->
    println("${String(Character.toChars(codePoint))} $codePoint")
}

方法2:手动处理索引遍历码点

通过循环控制索引,每次获取当前位置的完整码点,并根据码点占用的字符数移动索引:

val s = "Hëllø! € 😀"
var i = 0
while (i < s.length) {
    val codePoint = s.codePointAt(i)
    println("${String(Character.toChars(codePoint))} $codePoint")
    i += Character.charCount(codePoint)
}

两种方法都能输出符合预期的结果,完整显示高码点字符及其对应的Unicode码点。

内容的提问来源于stack exchange,提问作者Peter Kleiweg

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.16 03:11:03