You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用BeautifulSoup提取div标签内的全部内容(不含自身标签)

提取div标签内的内容(不含div本身)

你可以通过以下几种方法实现目标:

方法1:使用decode_contents()方法

BeautifulSoup的标签对象自带decode_contents()方法,能直接返回标签内部所有内容的HTML字符串,包含所有子标签和文本:

from bs4 import BeautifulSoup

html = '<div id="mydiv"><p>Hello</p><p>Goodbye</p>[...]</div>'
soup = BeautifulSoup(html, 'html.parser')
mydiv = soup.find(id='mydiv')
target_str = mydiv.decode_contents()
print(target_str)
# 输出: <p>Hello</p><p>Goodbye</p>[...]

方法2:遍历子节点拼接字符串

遍历div的所有子节点,将每个子节点转为字符串后拼接,也能得到目标结果:

target_str = ''.join(str(child) for child in mydiv.children)
print(target_str)
# 输出符合预期的内容

关于你之前用unwrap()的问题

unwrap()的作用是移除当前标签,把内容转移到父节点中。你的原始HTML只有这个div作为根节点,执行mydiv.unwrap()后,div的内容会成为soup的直接内容,但你打印的mydiv变量指向的是已经被掏空的div标签,所以显示空的div。如果要通过unwrap获取内容,应该打印soup:

mydiv.unwrap()
print(soup)
# 输出: <p>Hello</p><p>Goodbye</p>[...]

内容的提问来源于stack exchange,提问作者alias51

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.17 23:55:22