You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用requests.get获取搜索结果第二页返回第一页的解决方法求助

解决URL中#页码无法获取对应页面内容的问题

你遇到的这个情况其实很常见——URL末尾的#2属于锚点(fragment),它的作用是让浏览器定位到页面内的指定位置,并不会被发送到服务器端。所以当你用requests.get()请求这个URL时,服务器根本收不到#2这部分信息,自然返回的还是第一页的内容。

下面给你两个可行的解决思路:


思路1:定位真实的分页请求参数

这类电商网站的分页通常不会依赖锚点,而是通过URL参数或者API接口来加载不同页面的内容。你可以通过浏览器开发者工具找到真实的分页请求:

  1. 打开浏览器的开发者工具(按F12),切换到「网络」标签页
  2. 手动点击页面上的“第二页”按钮,观察浏览器发送的新请求
  3. 通常会发现请求里带有分页参数,比如page=2、offset=xx这类

找到真实的分页URL后,直接用requests请求即可。比如如果发现分页参数是page,代码可以改成:

import requests
from bs4 import BeautifulSoup

r = requests.get("https://www.epocacosmeticos.com.br/perfumes?page=2")
soup = BeautifulSoup(r.text, "html.parser")

思路2:用Selenium模拟浏览器加载

如果网站的分页是通过JavaScript动态渲染的,找不到明确的分页API,那就用Selenium模拟真实浏览器的行为——它会自动执行页面的JavaScript,加载出第二页的完整内容:
首先安装Selenium依赖:

pip install selenium

然后下载对应浏览器的驱动(比如ChromeDriver),编写代码:

from selenium import webdriver
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By
from bs4 import BeautifulSoup

# 初始化Chrome浏览器驱动
driver = webdriver.Chrome()
driver.get("https://www.epocacosmeticos.com.br/perfumes#2")

# 等待第二页内容加载完成(替换成页面中第二页独有的元素选择器)
WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.CSS_SELECTOR, ".product-list__item:nth-child(21)"))
)

# 获取加载完成后的页面源码
page_source = driver.page_source
soup = BeautifulSoup(page_source, "html.parser")

# 操作完成后关闭浏览器
driver.quit()

最后提醒:爬取网站前请务必查看网站的robots.txt和使用条款,确保爬取行为符合网站规则。

内容的提问来源于stack exchange,提问作者Mauro Noli Silveira

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.29 07:58:50