You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Selenium如何抓取依赖JavaScript分页、URL无变化的网站表格数据?

单页应用分页数据抓取解决方案

你遇到的是*单页应用(SPA)*的典型分页场景,页面路由不会随分页切换变化,有两种主流实现思路:

方案1:直接调用后端分页接口(效率更高,推荐)

你可以通过浏览器开发者工具的「网络」面板抓包获取分页接口:

  • 按F12打开开发者工具,切换到「网络」标签,筛选「Fetch/XHR」类型的请求
  • 手动点击一次下一页按钮,观察面板里新增的请求,找到携带分页参数的接口,一般返回格式为JSON,里面会包含完整的表格数据
  • 拿到接口规则后直接用requests库循环携带不同页码参数请求即可,无需启动浏览器,爬取效率更高

方案2:基于现有Selenium代码模拟翻页(适配性更强,适合新手)

如果接口有加密或者签名验证不好破解,可以直接用Selenium模拟用户操作翻页,逐页提取表格数据,参考实现逻辑:

from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
import time

# 你已有的初始化代码
driver = webdriver.Chrome(ChromeDriverManager().install())
driver.maximize_window()
driver.implicitly_wait(30)
driver.get("https://www.nepalstock.com.np/floor-sheet?fbclid=IwAR0-V615fp0ujUH8BRr3Zu4erfAtsCz0-RHUgjMIvhjpGsaya-S9v7xI_-8")

all_data = []
page_count = 10 # 可替换为你要爬取的总页数,也可以先获取站点最大页码做动态判断

for page in range(page_count):
    # 等待当前页表格加载完成
    table = WebDriverWait(driver, 10).until(
        EC.presence_of_element_located((By.TAG_NAME, "table"))
    )
    # 提取当前页表格行数据
    rows = table.find_elements(By.TAG_NAME, "tr")
    for row in rows[1:]: # 跳过表头行
        cells = row.find_elements(By.TAG_NAME, "td")
        row_data = [cell.text for cell in cells]
        all_data.append(row_data)
    
    # 点击下一页按钮,注意提前通过元素审查确认下一页按钮的正确选择器,此处为示例
    next_btn = WebDriverWait(driver, 10).until(
        EC.element_to_be_clickable((By.XPATH, "//button[contains(text(),'Next')]"))
    )
    next_btn.click()
    # 等待新一页内容加载完成,避免抓取重复数据
    time.sleep(2)

注意事项:

  • 提前通过元素审查确认下一页按钮的正确选择器,避免点击失败
  • 如果下一页按钮到最后一页会变为不可点击状态,可以加对应判断逻辑终止循环
  • 目标站点禁用右键不影响元素审查和Selenium操作,你使用ctrl+shift+c开启审查的操作是正确的

内容的提问来源于stack exchange,提问作者lord stock

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 08:57:04