Python爬虫循环爬取时跳过第一页的其他解决方案咨询
解决爬虫从第二页开始采集的问题
要实现爬虫跳过第一页、从第二页开始采集,有两种简单直接的解决办法:
- 修改循环起始值
直接调整循环的起始页码,把原本从1开始的遍历改成从2开始,这是代码改动最小的方案:
for page in range(2, page_cout + 1): data = {} print(f'[INFO] Processing {page} page') url = f"https://www.olx.ua/d/uk/elektronika/noutbuki-i-aksesuary/noutbuki/?currency=UAH&page={ page }" # 后续采集逻辑保持不变
- 循环内判断跳过第一页
如果不想改动循环的范围定义,可以在循环开头加入判断,当页码为1时直接跳过当前迭代:
for page in range(1, page_cout + 1): if page == 1: continue # 直接跳过第一页的处理 data = {} print(f'[INFO] Processing {page} page') url = f"https://www.olx.ua/d/uk/elektronika/noutbuki-i-aksesuary/noutbuki/?currency=UAH&page={ page }" # 后续采集逻辑保持不变
另外注意:原代码中采集商品详情页时,用url = f"{link}"覆盖了外层的列表页URL变量,虽然当前逻辑不会出错,但这种变量名重复容易引发后续调试问题,建议改成detail_url = f"{link}"再发起请求。
内容的提问来源于stack exchange,提问作者wollframe
相关产品推荐
相关产品推荐

