使用Beautiful Soup无法爬取薪资文本,请求技术协助
如何用BeautifulSoup爬取Wuzzuf职位页面的薪资信息
问题原因
你用requests直接获取的是页面的静态HTML源码,但Wuzzuf的职位详情页里的薪资信息是通过JavaScript动态渲染出来的。你最初找的css-4xky9y类元素在静态响应里根本不存在,所以find_all返回空列表。而你通过索引取DOM内容的方法完全依赖页面的固定结构,一旦网站更新布局就会失效,确实不规范。
解决方案
方案1:提取页面内嵌的JSON数据(推荐,无需额外依赖)
很多现代网站会把页面核心数据内嵌在HTML的<script>标签里,Wuzzuf也采用这种方式。我们可以直接提取这些JSON数据,从中拿到薪资信息,比解析DOM结构稳定得多。
代码示例:
import requests from bs4 import BeautifulSoup import json url = "https://wuzzuf.net/jobs/p/WBHqaf7WeZYe-Senior-Python-Developer-Trufla-Cairo-Egypt?o=1&l=sp&t=sj&a=python|search-v3" result = requests.get(url) soup = BeautifulSoup(result.content, "lxml") # 定位包含职位全量数据的script标签 script_tag = soup.find("script", id="__NEXT_DATA__") if script_tag: # 解析JSON格式的内容 job_data = json.loads(script_tag.string) # 从数据结构中提取薪资字段 salary = job_data["props"]["pageProps"]["job"]["salary"] print(f"薪资:{salary}") else: print("未找到职位数据标签")
方案2:用Selenium加载动态页面
如果遇到完全依赖JS渲染、没有内嵌JSON数据的情况,可以用Selenium模拟浏览器加载页面,等所有动态内容渲染完成后再解析。
首先需要安装依赖:
pip install selenium
还要下载对应浏览器的驱动(比如ChromeDriver,需和你的Chrome版本匹配)。
代码示例:
from selenium import webdriver from selenium.webdriver.chrome.options import Options from bs4 import BeautifulSoup url = "https://wuzzuf.net/jobs/p/WBHqaf7WeZYe-Senior-Python-Developer-Trufla-Cairo-Egypt?o=1&l=sp&t=sj&a=python|search-v3" # 配置无头模式(可选,不弹出浏览器窗口) chrome_options = Options() chrome_options.add_argument("--headless=new") # 启动浏览器并加载页面 driver = webdriver.Chrome(options=chrome_options) driver.get(url) # 获取渲染后的完整页面源码 page_source = driver.page_source soup = BeautifulSoup(page_source, "lxml") # 查找薪资元素(此时动态渲染的元素已存在) salary_element = soup.find("span", class_="css-4xky9y") if salary_element: print(f"薪资:{salary_element.text.strip()}") else: print("未找到薪资元素") # 关闭浏览器 driver.quit()
内容的提问来源于stack exchange,提问作者mena sabry
相关产品推荐
相关产品推荐

