You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy爬取Indeed无结果:403错误排查求助(新手)

403状态码的原因分析
  • 反爬机制拦截:Indeed作为大型招聘平台,有成熟的反爬系统,和专门供新手练习的books.toscrape不同,它会严格识别非浏览器发起的请求。你的Scrapy请求没通过反爬校验,就会被返回403禁止访问。
  • 请求头不规范:浏览器发起请求时会携带User-Agent、Accept-Language等标识自身身份的头信息,Scrapy默认的请求头过于简单,很容易被判定为爬虫。测试站不校验这些,所以之前能正常爬取,但Indeed会卡这一步。
  • IP被限制:如果你的IP短时间内请求过于频繁,或者该IP曾被标记为爬虫IP,Indeed会直接拒绝访问。不管是本地VSCode还是Colab的服务器IP,都可能触发了这个限制。
  • 缺少会话验证:Indeed可能需要Cookie来确认用户的合法会话,直接用Scrapy发起请求没有携带必要的Cookie,会被系统判定为异常请求,返回403。

内容的提问来源于stack exchange,提问作者embiekhochiu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.01 13:25:56