爬取Glassdoor遇403响应,多种方案尝试无效求解决
爬取Glassdoor企业评论遭遇403封禁问题
我之前长期爬取Glassdoor的企业评论,只用一行代码就能顺利请求:
page = http.get(url+ id + ".htm",timeout= 1000000,headers=HEADERS)
甚至不用设置请求头都能正常获取数据。但暂停项目6个月后,再次请求时始终返回<Response [403]>及安全页面HTML,无法获取有效数据。
我试过多种方案均未解决:
- 添加仅含
'Mozilla/5.0'的user-agent请求头 - 添加复杂user-agent请求头,如:
'Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/92.0.4515.107 Mobile Safari/537.36' - 参考Stack Overflow问题添加完整请求头
- 仅添加user-agent和Accept-Language参数(值为
'en-US;q=0.7,en;q=0.3') - 将httpx库替换为requests库
- 使用
session.get()替代requests.get()维持Cookie - 使用免费代理尝试绕过限制
目前怀疑IP被标记,当前代码已移除个人Cookie,请求头均来自Chrome调试工具。要求解决方案必须支持异步(如aiohttp+asyncio),此前曾用该方式并发请求。
内容的提问来源于stack exchange,提问作者Contone
相关产品推荐
相关产品推荐

