R语言raw格式字符转换结果异常,全角符号等无法正确编码
问题根因
你拿到的raw序列本身就是标准UTF-8编码的字符字节,出现乱码是因为R将转换后的字符串默认识别为系统本地编码(比如Windows平台的GBK、西欧环境的Latin-1),没有正确标记为UTF-8编码导致的。你之前遍历编码的测试方法传参错误,无法得到正确结果。
可行解决方案
方案1:手动给转换后的字符串指定UTF-8编码标记
无需额外转码,仅需给rawToChar输出的结果补充正确的编码标记即可:
# 全角&测试(对应raw值ef bc 86) amp_raw <- as.raw(c(0xef, 0xbc, 0x86)) res_amp <- rawToChar(amp_raw) Encoding(res_amp) <- "UTF-8" print(res_amp) # 输出:"&" # 全角引号测试 x_raw <- charToRaw("\uFF02") res <- rawToChar(x_raw) Encoding(res) <- "UTF-8" print(res) # 输出:""" # HYPHEN测试 hyphen_raw <- charToRaw("\u2010") res_hyphen <- rawToChar(hyphen_raw) Encoding(res_hyphen) <- "UTF-8" print(res_hyphen) # 输出:"‐"
方案2:使用stringi包的原生raw转字符串方法
直接调用stri_raw_to_char指定编码即可,无需额外处理:
library(stringi) # 全角& stri_raw_to_char(as.raw(c(0xef, 0xbc, 0x86)), encoding = "UTF-8") # 输出:"&" # 全角引号 stri_raw_to_char(charToRaw("\uFF02"), encoding = "UTF-8") # 输出:""" # HYPHEN stri_raw_to_char(charToRaw("\u2010"), encoding = "UTF-8") # 输出:"‐"
方案3:Web请求环节直接指定编码
如果是通过httr等工具请求获取的原始响应,直接在解析内容时指定UTF-8编码即可,无需手动处理raw:
library(httr) resp <- GET("你的请求地址") # 解析时直接指定编码 content_text <- content(resp, as = "text", encoding = "UTF-8")
内容的提问来源于stack exchange,提问作者user2793947
相关产品推荐
相关产品推荐

