You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为HTML相对子链接添加主域名,生成可调用的完整链接?

解决爬虫获取相对路径链接无法访问的问题

嗨,我来帮你搞定这个问题!你现在爬虫抓取到的链接是相对路径(比如/ci/content/story/...),没法直接用来访问网页,咱们只需要把它和网站的主域名拼接成绝对路径就行,这里推荐用Python标准库的urljoin方法,它能自动处理各种相对路径的情况,比直接字符串拼接更靠谱。

修改后的代码

import requests
from bs4 import BeautifulSoup
from urllib.parse import urljoin  # 导入urljoin方法

def get_cric_info_articles():
    base_url = "http://www.espncricinfo.com"  # 定义主域名作为基础URL
    cricinfo_article_link = f"{base_url}/ci/content/story/news.html"
    r = requests.get(cricinfo_article_link)
    cricinfo_article_html = r.text
    soup = BeautifulSoup(cricinfo_article_html, "html.parser")
    cric_info_items = soup.find_all("h2", {"class": "story-title"})
    cricinfo_article_dict = {}
    for item in cric_info_items:
        a_tag = item.find('a')
        article_title = a_tag.string
        relative_url = a_tag['href']
        # 用urljoin拼接基础URL和相对路径,生成绝对链接
        absolute_url = urljoin(base_url, relative_url)
        cricinfo_article_dict[article_title] = absolute_url
    return cricinfo_article_dict

print(get_cric_info_articles())

关键修改点说明

  • 新增了base_url变量存储网站主域名,方便后续复用和维护
  • 导入urllib.parse.urljoin,它会自动识别相对路径的格式(比如开头带/或者不带/的情况),正确拼接出可直接访问的绝对链接
  • 循环中先提取<a>标签的标题和相对路径,再用urljoin生成绝对路径后存入字典

这样修改后,你得到的结果就会是类似{'Bell-Drummond leads MCC in curta...': 'http://www.espncricinfo.com/ci/content/story/...'}的格式,所有链接都可以直接访问啦!

内容的提问来源于stack exchange,提问作者user9168798

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 03:24:01