无法抓取Glassdoor企业概况技术求助:以沃尔玛员工规模为例
排查Glassdoor企业信息抓取失败的原因
以下是针对你提供的代码无法获取沃尔玛员工规模信息的核心问题:
请求头缺失或未定义
代码中requests.get(url, headers)里的headers变量未定义,Glassdoor会校验请求头中的User-Agent、Cookie等字段,缺失这些会被判定为非浏览器请求,返回的页面可能是登录验证页或空内容,根本无法拿到目标数据。你需要补充完整的请求头,比如:headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36' }反爬机制拦截
Glassdoor有严格的反爬策略,包括IP限制、登录校验、人机验证等。直接用requests发起无状态请求,大概率会被拦截,返回的内容不是实际的企业概况页面。需要处理登录状态(携带有效Cookie),或使用代理IP绕过IP封锁,甚至可能需要处理验证码。动态内容未处理
员工规模这类信息可能是通过JavaScript动态加载的,BeautifulSoup只能解析静态HTML源码,无法获取JS渲染后的内容。这种情况下需要用Selenium、Playwright等工具模拟浏览器渲染页面,再提取数据。缺少目标元素提取逻辑
你的代码仅完成了请求页面和解析的步骤,没有编写提取员工规模的具体代码。就算拿到了正确的页面,也需要定位对应的HTML元素,比如查找包含员工规模的标签:# 示例(需根据实际页面结构调整) emp_size = soup.find('div', class_='css-1v5elnn e1pvx6aw1').text.strip()
内容的提问来源于stack exchange,提问作者Jaevapple
相关产品推荐
相关产品推荐

