You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用JSoup解析HTML:如何仅获取body外层文本(不含子标签文本)

如何用JSoup仅获取的外层文本(排除子标签内容)

嘿,这个需求其实用JSoup的节点操作就能轻松搞定!你要的是只获取标签本身直接包含的文本节点,完全排除子元素里的内容对吧?下面给你两种实用的实现方式:

方法一:直接用ownText()方法

JSoup的Element类自带了ownText()方法,它的作用就是仅返回当前元素自身的文本内容,不会包含任何子元素的文本,刚好匹配你的需求!

结合你提供的HTML示例,代码可以这么写:

// 你的HTML内容
String html = "<html> <body> <p class=\"mm3h\">ဂီတကဆွဲဆောင်အားကောင်းတဲ့ကျွန်တော်တို့ကိုဖြစ်စေတယ်လို့ထင်တယ်။</p> Music causes us to think eloquently. <a class=\"\" href=\"\" aria-label=\"--Ralph Waldo Emerson (1 item)\">--Ralph Waldo Emerson</a> </body> </html>";

// 解析HTML
Document doc = Jsoup.parse(html);
Element body = doc.body();

// 获取body自身的文本,并用trim()去除多余空白
String bodyOwnText = body.ownText().trim();

// 输出结果:Music causes us to think eloquently.
System.out.println(bodyOwnText);

为什么不用text()?

别搞混了——body.text()会把下所有子元素的文本都拼接起来,结果会是ဂီတကဆွဲဆောင်အားကောင်းတဲ့ကျွန်တော်တို့ကိုဖြစ်စေတယ်လို့ထင်တယ်။ Music causes us to think eloquently. --Ralph Waldo Emerson,这显然不是你要的效果。

方法二:遍历子节点筛选文本节点(更灵活)

如果你的里有多个分散的直接文本节点,或者需要更精细的文本处理(比如保留特定格式),可以手动遍历的子节点,只提取TextNode类型的内容:

Document doc = Jsoup.parse(html);
Element body = doc.body();
StringBuilder result = new StringBuilder();

for (Node node : body.childNodes()) {
    // 判断是否是文本节点
    if (node instanceof TextNode) {
        TextNode textNode = (TextNode) node;
        // 去除空白后如果不为空就添加到结果里
        String cleanText = textNode.text().trim();
        if (!cleanText.isEmpty()) {
            result.append(cleanText).append(" ");
        }
    }
}

// 最终结果,再做一次trim去除末尾多余空格
String finalBodyText = result.toString().trim();

这种方式能精准控制要提取的文本,适合结构更复杂的HTML场景。

内容的提问来源于stack exchange,提问作者Mthk

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.28 03:57:12