Java如何将土耳其特殊HTML实体转换为可读字符串?
解决土耳其特殊字符(HTML实体形式)的编码转换问题
在处理包含土耳其特殊字符的字符串时,发现这些字符以HTML实体形式存在(例如Ç对应Ç、Ü对应Ü),尝试通过UTF-8、ISO_8859_1编码转换的方式无法正常解析这些字符,以下是尝试过的无效代码:
- 编码转换尝试1:
data = new String(text.getBytes(StandardCharsets.ISO_8859_1));
- 编码转换尝试2:
data = StandardCharsets.UTF_8.decode(str_to_bb(text, StandardCharsets.UTF_8)).toString();
最终通过HTML实体解码的方式解决问题,使用StringEscapeUtils.unescapeHtml4()方法即可将HTML实体转换为对应的土耳其字符:
data = StringEscapeUtils.unescapeHtml4(text);
内容的提问来源于stack exchange,提问作者gurkan
相关产品推荐
相关产品推荐

