You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy无法获取网页全部HTML元素,爬取WWE明星名单失败

解决Scrapy爬取WWE明星列表无结果的问题

我之前也踩过动态内容爬取的坑,你的推测完全正确——这个网站的现役明星数据是通过JavaScript动态渲染的,Scrapy和requests默认只会获取初始的静态HTML,不会执行页面里的JS,所以自然拿不到你要的明星姓名。

下面给你几个实用的解决方案,按推荐优先级排序:

1. 用Scrapy配合Playwright(最推荐)

Playwright是微软推出的自动化测试工具,能完美模拟浏览器执行JS,Scrapy有官方集成的插件,用起来很顺手:

  • 先安装依赖:
    pip install scrapy-playwright
    
  • 在你的Scrapy项目settings.py里添加配置:
    DOWNLOAD_HANDLERS = {
        "http": "scrapy_playwright.handler.ScrapyPlaywrightDownloadHandler",
        "https": "scrapy_playwright.handler.ScrapyPlaywrightDownloadHandler",
    }
    PLAYWRIGHT_LAUNCH_OPTIONS = {"headless": True}  # 不想弹出浏览器就设为True,调试时可以改False
    
  • 在爬虫的start_requests里启用playwright:
    def start_requests(self):
        yield scrapy.Request(
            url="http://www.wwe.com/superstars",
            meta={"playwright": True},
            callback=self.parse
        )
    

这样请求到的就是JS渲染后的完整页面,之后你就可以用Scrapy的Selector正常提取明星姓名了。

2. 直接抓取后端API接口(更高效)

动态网站的数据一般都是从后端API拉取的,你可以通过浏览器抓包找到这个接口:

  1. 打开浏览器F12进入开发者工具,切换到「Network」标签
  2. 刷新页面,过滤「XHR/Fetch」请求,找返回明星数据的接口(比如类似/api/v1/superstars/active这种)
  3. 直接用Scrapy请求这个API接口,拿到的是结构化的JSON数据,不用再解析HTML,效率更高还不容易出错。

3. 自定义DownloaderMiddleware(备选)

如果不想用Playwright,也可以自己写中间件用Selenium或者Pyppeteer处理JS,但这种方法维护成本高,不如前两种直接,所以只作为备选方案。

调试小技巧

你可以用Scrapy Shell快速验证效果:

scrapy shell "http://www.wwe.com/superstars" --meta='{"playwright": true}'

在Shell里输入response.text就能看到完整的渲染后页面,确认是否包含明星姓名。

另外注意别爬太猛,网站可能有反爬机制,必要时加个DOWNLOAD_DELAY在settings里。

内容的提问来源于stack exchange,提问作者SPFort

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.22 09:25:55