You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何生成含年份周数的URL列表以用于BeautifulSoup网页爬取?

解决方案

你的问题出在两个核心点:一是周数没有格式化为两位数字符串(比如第1周需要写成01而非1,才能匹配示例URL的格式);二是周数范围有误,range(1,52)仅生成1到51周,全年通常有52周,需调整为range(1,53)。

代码实现

先修正年份与周数的定义,再通过以下两种方式生成所有合法URL:

方式1:嵌套循环(可读性强)

years = list(range(2005, 2023))
weeks = list(range(1, 53))  # 修正范围,覆盖1-52周

url_list = []
for year in years:
    for week in weeks:
        # 将周数格式化为两位数,自动补零
        formatted_week = f"{week:02d}"
        # 拼接正确URL
        url = f"https://www.debestseller60.nl/{year}{formatted_week}#top"
        url_list.append(url)

方式2:列表推导式(简洁高效)

years = list(range(2005, 2023))
weeks = list(range(1, 53))

url_list = [f"https://www.debestseller60.nl/{year}{week:02d}#top" for year in years for week in weeks]

关键说明

  • 周数补零:{week:02d}是Python的格式化语法,确保1-9周自动补零为01-09,完全匹配示例URL的格式要求。
  • 范围修正:Python的range是左闭右开区间,range(1,53)才能生成1到52的完整周数。

生成的url_list就是可用的URL集合,直接传入BeautifulSoup即可开展爬取。

内容的提问来源于stack exchange,提问作者jsb92

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 18:58:26