You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python 3.6 Scrapy爬虫两次跳转后无法获取数据问题求助

解决Scrapy爬虫无法跳转至统计页面的问题

嘿,我看了你的代码,发现几个大概率导致爬虫卡在第一步的问题,咱们一步步来排查修复:

1. URL拼接容易出错,建议用response.urljoin()替代手动拼接

你现在手动拼接URL的方式"http://www.kicker.de" + statsPage有不小风险:如果statsPage本身已经是完整的绝对URL(比如包含http://www.kicker.de),拼接后就会变成重复域名的无效链接,Scrapy请求这种链接会直接失败,自然不会进入parse_statspage。

换成response.urljoin(statsPage)就省心多了,它会自动识别相对路径和绝对路径,生成正确的URL。修改后的代码片段:

# Step 1 修改后
def parse(self, response):
    for match in response.xpath('//*[contains(concat( " ", @class, " " ), concat( " ", "aligncenter", " " ))]//a/@href').extract():
        yield scrapy.Request(response.urljoin(match), callback=self.parse_matchpage)

# Step 2 修改后
def parse_matchpage(self, response):
    for statsPage in response.xpath('//*[contains(concat( " ", @class, " " ), concat( " ", "nav4tab-sel", " " ))]//a/@href').extract():
        yield scrapy.Request(response.urljoin(statsPage), callback=self.parse_statspage)

2. 检查parse_matchpage里的XPath选择器是否有效

这是最可能的核心问题——你的XPath可能没匹配到任何元素,所以根本没生成新的请求。你可以用Scrapy Shell快速验证:

  1. 打开终端,运行scrapy shell "http://www.kicker.de/某个具体的比赛页面链接"(从第一步爬取的链接里挑一个实际存在的)
  2. 在Shell里输入你的XPath:response.xpath('//*[contains(concat( " ", @class, " " ), concat( " ", "nav4tab-sel", " " ))]//a/@href').extract()
  3. 如果返回空列表[],说明这个XPath选不到内容,得调整选择器。

比如你可以换个思路,直接找文本包含统计相关关键词的链接(假设页面里的链接文本是“Statistik”):

statsPage = response.xpath('//a[contains(text(), "Statistik")]/@href').extract_first()
if statsPage:
    yield scrapy.Request(response.urljoin(statsPage), callback=self.parse_statspage)

用extract_first()代替循环更合理,因为每个比赛页面应该只有一个统计页面链接。

3. 排查是否是动态内容导致的

如果上面两步都没问题,但还是没拿到链接,那可能统计页面的链接是JavaScript动态生成的。Scrapy默认不执行JS,这种情况下你需要用Selenium或者Scrapy-Splash这类工具来渲染页面,再提取链接。

先优先解决前两个问题,这是新手最容易踩的坑~

内容的提问来源于stack exchange,提问作者agustin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 07:05:31