You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

无法抓取Glassdoor企业概况技术求助:以沃尔玛员工规模为例

排查Glassdoor企业信息抓取失败的原因

以下是针对你提供的代码无法获取沃尔玛员工规模信息的核心问题:

  • 请求头缺失或未定义
    代码中requests.get(url, headers)里的headers变量未定义,Glassdoor会校验请求头中的User-Agent、Cookie等字段,缺失这些会被判定为非浏览器请求,返回的页面可能是登录验证页或空内容,根本无法拿到目标数据。你需要补充完整的请求头,比如:

    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36'
    }
    
  • 反爬机制拦截
    Glassdoor有严格的反爬策略,包括IP限制、登录校验、人机验证等。直接用requests发起无状态请求,大概率会被拦截,返回的内容不是实际的企业概况页面。需要处理登录状态(携带有效Cookie),或使用代理IP绕过IP封锁,甚至可能需要处理验证码。

  • 动态内容未处理
    员工规模这类信息可能是通过JavaScript动态加载的,BeautifulSoup只能解析静态HTML源码,无法获取JS渲染后的内容。这种情况下需要用Selenium、Playwright等工具模拟浏览器渲染页面,再提取数据。

  • 缺少目标元素提取逻辑
    你的代码仅完成了请求页面和解析的步骤,没有编写提取员工规模的具体代码。就算拿到了正确的页面,也需要定位对应的HTML元素,比如查找包含员工规模的标签:

    # 示例(需根据实际页面结构调整)
    emp_size = soup.find('div', class_='css-1v5elnn e1pvx6aw1').text.strip()
    

内容的提问来源于stack exchange,提问作者Jaevapple

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.11 00:05:27