You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用BeautifulSoup获取指定ol标签内的嵌套li元素?

解答

1. 获取目标列表项的正确方式

结合验证结果,以下两种写法都能正确提取目标元素:

# 方法1:CSS选择器直接匹配
messages = soup.select('.messageList > li')

# 方法2:先定位父容器再提取直接子元素
message_list = soup.find('ol', class_='messageList')
messages = message_list.find_all('li', recursive=False)

之前失败的核心原因是手动下载的HTML文件结构不完整/损坏,导致BeautifulSoup无法解析出目标元素。直接通过requests获取网页原始响应内容,能保证HTML结构的完整性,因此可以成功匹配。

2. BeautifulSoup是否需要知晓嵌套路径?

不需要强制知晓完整嵌套路径:

  • soup.find_all("li")默认会返回文档中所有层级的<li>元素,无论嵌套深度,仅当设置recursive=False时才会只查找当前节点的直接子元素。
  • 你之前调用该方法返回0个结果,是因为本地损坏的HTML文件解析后不存在<li>元素,而非方法本身错误。

非BeautifulSoup解决方案(基于lxml)

可以使用lxml的XPath语法实现提取:

import requests
from lxml import etree

url = "https://www.propertychat.com.au/community/threads/melbourne-property-market-2024.75213/"
response = requests.get(url)
tree = etree.HTML(response.text)

# XPath匹配目标li元素
messages = tree.xpath('//ol[@class="messageList"]/li')

内容的提问来源于stack exchange,提问作者sachinruk

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.03 01:56:00