Python Selenium爬取多页面仅返回最后一页数据如何解决
问题根因
- 未配置动态内容等待逻辑:Selenium触发搜索回车操作后,不会自动等待页面JS渲染完成,回车后立刻抓取页面源码时,首个邮编对应的搜索结果还未加载出
class="LocationName"的标签,自然无法获取到「HEROES COMICS」条目,抓取结果完全受网络波动影响,稳定性极差。 - 代码结构存在性能问题:浏览器实例初始化放在邮编遍历循环内部,每处理一个邮编就新开一个Chrome窗口,批量处理10个以上邮编时会产生大量冗余进程占用内存,还容易触发站点反爬机制。
适配批量爬取的修复代码
from bs4 import BeautifulSoup from selenium import webdriver from selenium.webdriver.chrome.service import Service from webdriver_manager.chrome import ChromeDriverManager from selenium.webdriver.common.keys import Keys from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC import time # 可任意扩展邮编列表,支持10个及以上批量处理 mylist = ['93729', '75077'] # 初始化浏览器(仅启动一次,所有邮编复用) driver = webdriver.Chrome(service=Service(ChromeDriverManager().install())) driver.get('https://www.comicshoplocator.com/StoreLocator') driver.maximize_window() # 配置显式等待:最长等待10秒,直到目标元素加载完成 wait = WebDriverWait(driver, 10) for zip_code in mylist: # 定位搜索框,清空上一次搜索的内容 search_input = driver.find_element(By.NAME, 'query') search_input.clear() search_input.send_keys(zip_code) search_input.send_keys(Keys.ENTER) # 等待所有店铺名称标签加载完成后再解析页面 wait.until(EC.presence_of_all_elements_located((By.CLASS_NAME, 'LocationName'))) soup = BeautifulSoup(driver.page_source, 'lxml') # 输出当前邮编对应的所有店铺名 for store_tag in soup.find_all('div', class_="LocationName"): print(store_tag.text.strip()) # 间隔1秒再处理下一个邮编,模拟人工操作节奏避免被封 time.sleep(1) # 所有任务完成后关闭浏览器,释放资源 driver.quit()
优化说明
- 浏览器实例仅初始化一次,所有邮编爬取复用同一个窗口,资源占用低、爬取速度快,支持任意长度的邮编列表批量处理
- 采用显式等待机制替代无意义的固定延时:既保证动态内容加载完成后再抓取,避免漏数据,也不会浪费多余等待时间
- 每次搜索前自动清空搜索框残留内容,避免多邮编拼接导致搜索错误
- 新增请求间隔逻辑,降低被站点反爬拦截的概率
- 脚本运行结束后自动关闭浏览器进程,无残留进程占用系统资源
内容的提问来源于stack exchange,提问作者Ave
相关产品推荐
相关产品推荐

