使用BeautifulSoup+Selenium爬取GE家电站点产品链接返回0如何解决?
问题原因
- 未等待动态内容加载完成:调用
browser.get()后立即获取页面源码,该站点的产品列表为异步渲染内容,此时DOM还未完成产品节点的渲染,拿到的是初始未加载完成的页面源码,自然不存在li.product节点。 - 元素存在判断逻辑错误:代码中
if (name != '')的判断条件有误,BeautifulSoup的find方法找不到元素时返回的是None而非空字符串,即使后续节点加载成功也会出现判断逻辑异常。 - 可能存在Selenium特征被反爬拦截:部分站点会识别Selenium的自动化特征,拦截请求后返回无产品内容的验证页或空白页。
- 驱动与浏览器版本不兼容:你导入了
webdriver_manager但未使用,手动指定的geckodriver如果和当前火狐浏览器版本不匹配,也可能出现页面渲染异常的问题。
可行解决办法
- 新增显式等待逻辑,确保产品节点渲染完成后再解析源码,优化后的完整代码示例如下:
import time from selenium import webdriver from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from selenium.webdriver.common.by import By from bs4 import BeautifulSoup links = [] # 配置火狐浏览器参数,屏蔽自动化特征 options = webdriver.FirefoxOptions() options.add_argument('--disable-blink-features=AutomationControlled') # 初始化浏览器,也可以直接用webdriver_manager自动管理驱动版本,避免版本不兼容问题 # browser = webdriver.Firefox(executable_path=GeckoDriverManager().install(), options=options) browser = webdriver.Firefox(executable_path="C:\\Users\\drivers\\geckodriver\\win64\\v0.29.1\\geckodriver.exe", options=options) browser.get("https://www.geappliances.com/ge-appliances/kitchen/ranges/") # 显式等待最多20秒,直到li.product节点出现 WebDriverWait(browser, 20).until(EC.presence_of_element_located((By.CSS_SELECTOR, 'li.product'))) content = browser.page_source soup = BeautifulSoup(content, "html.parser") for main in soup.find_all('li', attrs = {'class' : 'product'}): name = main.find('a', href=True) # 修正判断逻辑 if name is not None: links.append(name.get('href').strip()) print("Got links : ", len(links)) browser.quit()
- 如果加了显式等待还是无法找到节点,可以先打印
soup.prettify()检查返回的页面内容,确认是否被反爬拦截返回了验证页面,若遇到验证可以适当增加页面停留时间,或添加Cookie绕过验证。 - 建议直接使用
webdriver_manager的GeckoDriverManager().install()自动匹配驱动版本,避免手动指定驱动的版本兼容问题。
内容的提问来源于stack exchange,提问作者Harshal Naik
相关产品推荐
相关产品推荐

