You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Python3+BeautifulSoup爬取Glassdoor微软评论时随机跳页求助

问题分析与解决方案

核心问题

  1. 请求逻辑混乱:代码存在冗余请求,初始页面(P1)完全未处理,循环内的URL更新和请求顺序错误,导致页面遍历逻辑出错。
  2. 反爬机制触发:未设置请求头(如User-Agent),固定0.5秒的延迟过短,容易被Glassdoor的反爬系统识别为爬虫,返回空页面或无效内容,表现为“随机跳页”。
  3. 未处理请求失败:注释掉了状态码判断,即使请求返回错误(如403、500),仍继续解析空内容,导致无输出。
  4. 元素匹配风险:使用zip匹配两个find_all结果,若某一页两类元素数量不一致,会直接截断,导致部分内容不输出。

修正步骤

  • 修复请求逻辑:按顺序遍历每一页,确保每个页面只请求一次,从P1开始处理。
  • 添加请求头:模拟浏览器请求,避免被识别为爬虫。
  • 优化延迟策略:使用随机延迟(如1-3秒),避免固定间隔触发反爬。
  • 处理请求异常:检查响应状态码,失败时重试或跳过,同时捕获请求异常。
  • 改进元素匹配:通过评论容器整体遍历,避免zip带来的不匹配问题。

修正后的代码

from bs4 import BeautifulSoup
import requests
import time
import random
import csv

# 请求头,模拟Chrome浏览器
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36'
}

# 从第1页开始遍历,最多爬取10页
max_pages = 10
for i in range(1, max_pages + 1):
    url = f"https://www.glassdoor.com/Reviews/Microsoft-Reviews-E1651_P{i}.htm?filter.iso3Language=eng"
    
    try:
        # 发送请求,设置超时
        response = requests.get(url, headers=headers, timeout=10)
        # 检查响应状态
        if response.status_code != 200:
            print(f"页面{i}请求失败,状态码: {response.status_code}")
            # 失败后延迟更久再重试一次
            time.sleep(random.uniform(3, 5))
            response = requests.get(url, headers=headers, timeout=10)
            if response.status_code != 200:
                print(f"页面{i}重试仍失败,跳过")
                continue
        
        # 随机延迟,避免固定间隔触发反爬
        time.sleep(random.uniform(1, 3))
        
        soup = BeautifulSoup(response.content, "html.parser")
        
        # 找到所有评论容器,从容器内提取Pros和Cons
        review_containers = soup.find_all("div", class_="gdReview")
        if not review_containers:
            print(f"页面{i}未找到评论内容,可能被反爬拦截")
            continue
        
        for container in review_containers:
            # 提取Pros/Cons标签和内容
            label = container.find("p", class_="mb-0 strong")
            content = container.find("p", class_="mt-0 mb-0 pb v2__EIReviewDetailsV2__bodyColor v2__EIReviewDetailsV2__lineHeightLarge v2__EIReviewDetailsV2__isExpanded")
            if label and content:
                print(label.text.strip())
                print(content.span.text.strip())
                print(f"页面{i}")
                print()
                
    except requests.exceptions.RequestException as e:
        print(f"页面{i}请求异常: {str(e)}")
        continue

额外提示

  • 如果仍然被拦截,可能需要添加Cookie(可从浏览器登录Glassdoor后复制),或使用代理IP。
  • 不要设置过大的max_pages,避免给目标网站造成过大压力,同时降低被封风险。

内容的提问来源于stack exchange,提问作者Shawn Marion fan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.07 17:45:37