You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用BeautifulSoup选择子元素及所有titleline的href属性

用BeautifulSoup提取所有对应titleline元素的href属性

前提准备

先安装必要的库:

pip install beautifulsoup4 lxml

不同场景的提取方法

根据titleline的实际存在形式,分几种常见情况处理:

情况1:titleline是a标签的class

如果目标链接是带titleline类的<a>标签(比如<a class="titleline" href="xxx">),可以这么写:

from bs4 import BeautifulSoup

# 替换成你的实际HTML内容
html_content = """
<div>
    <a class="titleline" href="article1.html">文章标题1</a>
    <a class="titleline" href="article2.html">文章标题2</a>
</div>
"""

# 解析HTML
soup = BeautifulSoup(html_content, "lxml")
# 选中所有class为titleline的a标签
titleline_a_tags = soup.select("a.titleline")
# 提取每个标签的href属性
all_hrefs = [tag.get("href") for tag in titleline_a_tags]

print(all_hrefs)  # 输出: ['article1.html', 'article2.html']

情况2:titleline是a标签的自定义属性

如果titleline是<a>标签的自定义属性(比如<a titleline="active" href="xxx">),调整选择器即可:

from bs4 import BeautifulSoup

html_content = """
<a titleline="active" href="note1.html">笔记1</a>
<a titleline="active" href="note2.html">笔记2</a>
"""

soup = BeautifulSoup(html_content, "lxml")
# 选中所有带titleline属性的a标签
titleline_a_tags = soup.select('a[titleline]')
all_hrefs = [tag.get("href") for tag in titleline_a_tags]

print(all_hrefs)  # 输出: ['note1.html', 'note2.html']

补充:titleline是父元素的class

如果titleline是父元素的类,链接在子级<a>标签里(比如<div class="titleline"><a href="xxx">),选择器改成:

titleline_a_tags = soup.select(".titleline a")

内容的提问来源于stack exchange,提问作者Alper Özgür ŞAHİN

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 23:35:23