You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

爬取Glassdoor遇403响应,多种方案尝试无效求解决

爬取Glassdoor企业评论遭遇403封禁问题

我之前长期爬取Glassdoor的企业评论,只用一行代码就能顺利请求:

page = http.get(url+ id + ".htm",timeout= 1000000,headers=HEADERS)

甚至不用设置请求头都能正常获取数据。但暂停项目6个月后,再次请求时始终返回<Response [403]>及安全页面HTML,无法获取有效数据。

我试过多种方案均未解决:

  • 添加仅含'Mozilla/5.0'的user-agent请求头
  • 添加复杂user-agent请求头,如:
    'Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/92.0.4515.107 Mobile Safari/537.36'
    
  • 参考Stack Overflow问题添加完整请求头
  • 仅添加user-agent和Accept-Language参数(值为'en-US;q=0.7,en;q=0.3')
  • 将httpx库替换为requests库
  • 使用session.get()替代requests.get()维持Cookie
  • 使用免费代理尝试绕过限制

目前怀疑IP被标记,当前代码已移除个人Cookie,请求头均来自Chrome调试工具。要求解决方案必须支持异步(如aiohttp+asyncio),此前曾用该方式并发请求。

内容的提问来源于stack exchange,提问作者Contone

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 15:47:09