You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用BS4将抓取的链接转为「文章名:链接」格式的字典?

解决方法:提取「文章名:链接」字典的步骤

核心问题分析

你的列表中出现None,是因为某个i值对应的a标签在页面中不存在,直接处理会导致提取失败,因此需要先过滤无效元素,再提取属性。

具体实现步骤

  • 过滤无效元素:从列表中剔除None,只保留有效的BeautifulSoup标签对象
  • 提取关键信息:对每个有效标签,分别提取文章标题(标签文本)和链接(href属性)
  • 构建目标字典:将标题作为键、完整链接作为值存入字典

完整代码示例

from bs4 import BeautifulSoup
import requests

# 爬取目标页面
url = "https://www.marketingdive.com"
response = requests.get(url)
soup = BeautifulSoup(response.text, "html.parser")

# 收集目标a标签(包含None)
a_tags = []
for i in range(6):
    target_tag = soup.find("a", class_=f"analytics t-dash-top-{i}")
    a_tags.append(target_tag)

# 过滤None,仅保留有效标签
valid_tags = [tag for tag in a_tags if tag is not None]

# 构建文章名-链接字典
article_dict = {}
for tag in valid_tags:
    # 提取并清理标题文本
    article_title = tag.text.strip()
    # 提取链接,处理相对路径
    article_link = tag.get("href")
    if article_link and not article_link.startswith("http"):
        article_link = f"{url}{article_link}"
    # 存入字典
    article_dict[article_title] = article_link

# 输出结果
print(article_dict)

关键注意事项

  • 使用tag.get("href")而非tag["href"]:前者在标签无href属性时返回None,避免抛出KeyError
  • 处理相对路径:页面内的链接可能是相对路径(如/news/xxx),需拼接原网站URL形成可直接访问的完整链接
  • 清理标题文本:用strip()去除标题前后的空格、换行符等冗余内容,保证字典键的整洁

内容的提问来源于stack exchange,提问作者Spookr

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.18 13:05:24