You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用BeautifulSoup提取最后一个li标签后的所有内容?

提取最后一个
  • 标签后的内容并合并输出
  • 实现步骤

    • 先提取所有顶级<li>标签的文本内容,复用你已有的逻辑
    • 定位最后一个<li>标签,遍历它的后续兄弟节点,过滤掉无效的空白文本节点,只保留标签元素的内容
    • 合并<li>内容和后续内容,用--sep--分隔输出

    完整代码示例

    from bs4 import BeautifulSoup
    
    # 假设你的HTML内容已存入html变量
    soup = BeautifulSoup(html, 'html.parser')
    
    # 1. 提取所有顶级<li>的内容
    top_li_tags = soup.find_all('li')
    li_contents = [tag.get_text(strip=True) for tag in top_li_tags]
    
    # 2. 提取最后一个<li>之后的所有标签内容
    post_li_contents = []
    if top_li_tags:
        last_li = top_li_tags[-1]
        # 遍历后续兄弟节点,过滤空白文本节点
        for sibling in last_li.next_siblings:
            # 只处理带标签名的元素(排除纯空白文本)
            if sibling.name:
                post_li_contents.append(sibling.get_text(strip=True))
    
    # 3. 合并并输出结果
    all_content = li_contents + post_li_contents
    print('--sep--'.join(all_content))
    

    关键说明

    • next_siblings会返回当前节点之后的所有兄弟节点(包括文本和标签),用sibling.name可以快速过滤掉无意义的空白文本
    • get_text(strip=True)用于去除文本前后的空白字符,让输出更整洁
    • 如果文档中没有顶级<li>标签,代码会自动跳过后续提取逻辑,避免报错

    内容的提问来源于stack exchange,提问作者Ajay Senthilrajan

    相关产品推荐
    方舟 Agent Plan

    超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

    最近更新时间:2026.08.09 19:20:35