如何用BeautifulSoup提取最后一个li标签后的所有内容?
提取最后一个标签后的内容并合并输出
实现步骤
- 先提取所有顶级
<li>标签的文本内容,复用你已有的逻辑 - 定位最后一个
<li>标签,遍历它的后续兄弟节点,过滤掉无效的空白文本节点,只保留标签元素的内容 - 合并
<li>内容和后续内容,用--sep--分隔输出
完整代码示例
from bs4 import BeautifulSoup # 假设你的HTML内容已存入html变量 soup = BeautifulSoup(html, 'html.parser') # 1. 提取所有顶级<li>的内容 top_li_tags = soup.find_all('li') li_contents = [tag.get_text(strip=True) for tag in top_li_tags] # 2. 提取最后一个<li>之后的所有标签内容 post_li_contents = [] if top_li_tags: last_li = top_li_tags[-1] # 遍历后续兄弟节点,过滤空白文本节点 for sibling in last_li.next_siblings: # 只处理带标签名的元素(排除纯空白文本) if sibling.name: post_li_contents.append(sibling.get_text(strip=True)) # 3. 合并并输出结果 all_content = li_contents + post_li_contents print('--sep--'.join(all_content))
关键说明
next_siblings会返回当前节点之后的所有兄弟节点(包括文本和标签),用sibling.name可以快速过滤掉无意义的空白文本get_text(strip=True)用于去除文本前后的空白字符,让输出更整洁- 如果文档中没有顶级
<li>标签,代码会自动跳过后续提取逻辑,避免报错
内容的提问来源于stack exchange,提问作者Ajay Senthilrajan
相关产品推荐
相关产品推荐

