You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何阻止Jsoup将UTF-8实体转换为UTF-16字符?

解决方案

核心问题

你用text()方法时,Jsoup会自动解析HTML实体为对应字符,这是该方法的设计目的(提取纯文本)。而默认的HTML解析/输出逻辑会把实体转换成UTF-16字符,导致你需要的原始实体编码丢失。

方法1:解析时保留原始实体

通过配置Jsoup解析器,让它不解析HTML实体,直接保留原始编码格式:

// 创建解析器并设置忽略实体解析
Parser parser = Parser.htmlParser().entityMode(EntityMode.IGNORE);
// 使用自定义解析器解析HTML
Document doc = Jsoup.parse(myHtml, "", parser);
// 提取目标元素并输出HTML(保留原始实体)
Element targetElement = doc.getElementsByClass("myClass").first();
String preservedHtml = targetElement.toString();

这个方法会让Jsoup在解析阶段就不转换•这类实体,输出时自然保留原始编码。

方法2:输出时将字符转回实体

如果你已经完成了解析(实体已被转成字符),可以通过配置输出设置,让Jsoup在输出HTML时把特定字符转回对应的实体编码:

Document doc = Jsoup.parse(myHtml);
Element targetElement = doc.getElementsByClass("myClass").first();

// 配置输出设置,启用XHTML转义模式(会将特殊字符转成实体)
Document.OutputSettings outputSettings = new Document.OutputSettings();
outputSettings.escapeMode(EscapeMode.xhtml);

// 应用设置并输出
targetElement.outputSettings(outputSettings);
String escapedHtml = targetElement.html();

注意:这种方法依赖Jsoup的内置实体映射,确保目标字符(如•)能被正确映射回•。

避坑提示

  • 不要用text()方法获取带实体的内容:text()的作用是提取纯文本,必然会解析所有实体为字符。
  • Parser.unescapeEntities()是把实体转成字符,和你的需求完全相反,所以不要使用。

内容的提问来源于stack exchange,提问作者DavesPlanet

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.07 07:37:38