You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Python从HTML页面提取所有title属性值并存入数组

提取HTML中所有元素的title属性内容

没问题,这事儿其实很简单,BeautifulSoup已经帮你把属性解析的活儿都干了,不用自己折腾正则去匹配单双引号——直接用它的内置方法就能搞定!

你已经完成了请求和解析页面的步骤,接下来只需要两步就能拿到所有title属性的内容:

完整代码示例

import requests
import bs4

# URL
URL = "https://en.wikipedia.org/wiki/Main_Page"
# 发送请求
response = requests.get(URL)
# 解析响应(这里建议用`html.parser`替代`html`,是官方推荐的标准解析器)
soup = bs4.BeautifulSoup(response.text, 'html.parser')

# 提取所有带title属性的元素的内容
title_contents = []
for element in soup.find_all(True, {'title': True}):
    # 直接通过元素的属性键获取值,BeautifulSoup会自动处理单/双引号的情况
    title_value = element['title']
    title_contents.append(title_value)

# 查看结果
print(title_contents)

代码解释

  • soup.find_all(True, {'title': True}):第一个参数True表示匹配所有类型的HTML标签,第二个参数是属性筛选条件,只保留带有title属性的元素。
  • element['title']:直接提取元素的title属性值,不管原HTML里用的是单引号还是双引号,BeautifulSoup都已经帮你解析成了干净的字符串,不需要额外处理。

更简洁的写法(列表推导式)

如果喜欢更紧凑的代码,可以用列表推导式一步生成结果:

title_contents = [elem['title'] for elem in soup.find_all(True, {'title': True})]

这样得到的title_contents就是一个包含所有title属性值的列表,你可以根据需求去重、筛选或者做其他处理~

内容的提问来源于stack exchange,提问作者user3043636

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.28 19:52:30