You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy CrawlSpider爬取cvvp.nva.gov.lv时无法跟踪域名内链接怎么办

问题根因

你要爬取的cvvp.nva.gov.lv是基于前端哈希路由的单页应用(SPA):

  1. URL中#后的内容属于前端路由标识,不会被发送到服务端,你发起请求拿到的200响应其实是站点的空白静态HTML模板
  2. 所有页面内容、可跳转链接都是浏览器加载并执行完JS代码后动态渲染生成的,静态HTML中不存在任何可被LinkExtractor识别的<a>标签链接,所以爬取规则匹配不到任何待跟进的URL,爬虫跑完起始页就直接结束。
  3. 你测试用的books.toscrape.com是传统服务端渲染站点,静态HTML中直接包含所有可爬链接,所以相同代码可以正常运行。

解决方案

  • 方案1:对接动态渲染服务
    推荐使用scrapy-playwright扩展,直接调用浏览器内核加载页面,等JS执行完成、内容渲染完毕后再提取链接,对SPA站点的适配成本低、兼容性好。也可以选择scrapy-splash对接Splash渲染服务实现相同效果。
  • 方案2:逆向后端接口
    打开浏览器控制台的网络面板,筛选XHR/ Fetch类型请求,找到站点加载列表、详情数据的真实后端接口,直接构造请求调用接口获取数据,无需爬取页面,爬取效率最高。

内容的提问来源于stack exchange,提问作者d1spstack

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.05 07:36:01