使用Python Beautiful Soup爬取Seesaw网站评论返回空结果问题咨询
问题诊断
- 客户端渲染(SPA)问题:你要爬取的Seesaw平台是基于Angular开发的单页应用(SPA),你用
requests.get拿到的仅为未经过JS渲染的初始静态HTML骨架,所有评论、班级活动等动态内容都是浏览器加载JS后异步请求接口、再动态插入到页面中的,初始HTML里不存在你要找的span.ng-binding元素,自然抓取结果为空。 - 缺少身份验证凭证:该平台属于私有教学工具,查看指定班级的活动和评论需要登录账号获得权限。你直接发送的裸请求没有携带登录后的Cookie、授权令牌等身份信息,服务端不会返回对应班级的私有数据,大概率返回的是登录引导页内容。
- 冗余导入问题(非直接报错原因):你的代码存在重复导入(
requests、BeautifulSoup均导入了两次),同时导入的urlopen、get等模块未被使用,属于不规范写法。
修复方案
- 方案1:使用模拟浏览器工具渲染页面
可以使用Selenium、Playwright等工具模拟真实浏览器行为,登录账号后等待页面动态渲染完成,再提取对应元素,示例代码参考:
from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC # 初始化浏览器 driver = webdriver.Chrome() # 先登录账号(这里需要补充你自己的登录逻辑,比如输入账号密码点击登录) driver.get("https://app.seesaw.me/") # 等待登录完成后跳转到目标班级页 driver.get("https://app.seesaw.me/#/activities/class/class.93a29acf-0eef-4d4e-9d56-9648d2623171") # 等待评论元素渲染完成 WebDriverWait(driver, 10).until( EC.presence_of_element_located((By.CSS_SELECTOR, "span.ng-binding")) ) # 提取所有评论 comments = driver.find_elements(By.CSS_SELECTOR, "span.ng-binding") for comment in comments: print(comment.text) driver.quit()
- 方案2:直接请求数据接口
打开浏览器F12开发者工具,切换到「网络」标签,刷新页面后筛选XHR/异步请求,找到返回评论数据的后端接口,直接携带登录后的请求头、Cookie请求该接口获取结构化数据,效率比模拟浏览器更高。
内容的提问来源于stack exchange,提问作者Thunder
相关产品推荐
相关产品推荐

