Selenium爬取房产代理数据遇NoSuchElementException报错排查
代码问题排查与修复方案
核心问题点
- 重复点击同一元素:循环中
driver.find_element(By.TAG_NAME, "h3").click()每次只会定位页面第一个h3标签,无法遍历25个代理的链接,导致后续操作全在同一个详情页重复执行。 - 未处理页面跳转与返回:点击进入详情页后,没有回到列表页,后续循环仍在详情页执行,自然找不到列表页的元素,逻辑完全混乱。
- 未等待详情页元素加载:进入详情页后直接查找
my_map_adress元素,没有等待页面渲染完成,大概率因为元素未加载触发NoSuchElementException。 - BeautifulSoup逻辑完全错误:试图在列表页的HTML源码中提取详情页的
h1和my_map_adress元素,这两个元素仅存在于详情页,列表页根本没有,此部分代码完全无效;同时判断条件中混淆了class和id属性,agent.find({'class': 'my_map_adress'})与目标元素的id不匹配。
修复后的代码
from bs4 import BeautifulSoup from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support import expected_conditions as EC from selenium.webdriver.support.ui import WebDriverWait elemental_list = [] driver = webdriver.Chrome() for page in range(1, 21): page_url = f"https://www.fastexpert.com/top-real-estate-agents/florida/?page={page}" driver.get(page_url) # 等待列表页所有代理卡片加载完成 WebDriverWait(driver, 20).until( EC.presence_of_all_elements_located((By.CSS_SELECTOR, "div.TOPREPT_RRT h3")) ) # 获取当前页所有代理的h3元素(链接) agent_links = driver.find_elements(By.CSS_SELECTOR, "div.TOPREPT_RRT h3") for link in agent_links[:25]: # 确保只处理前25个代理 try: link.click() # 点击进入详情页 # 等待详情页姓名元素加载 WebDriverWait(driver, 20).until( EC.presence_of_element_located((By.TAG_NAME, "h1")) ) # 尝试获取地址元素,处理不存在的情况 try: address = driver.find_element(By.ID, "my_map_adress").text.strip() except: address = "" name = driver.find_element(By.TAG_NAME, "h1").text.strip() elemental_list.append((name, address)) driver.back() # 返回列表页 # 等待列表页代理链接重新加载 WebDriverWait(driver, 20).until( EC.presence_of_all_elements_located((By.CSS_SELECTOR, "div.TOPREPT_RRT h3")) ) # 重新获取代理链接列表(因为页面返回后元素状态可能变化) agent_links = driver.find_elements(By.CSS_SELECTOR, "div.TOPREPT_RRT h3") except Exception as e: print(f"处理代理时出错: {e}") driver.back() # 出错时确保返回列表页 continue # 打印结果 for item in elemental_list: print(item) driver.quit()
修复说明
- 遍历所有代理链接:通过
find_elements获取当前页所有代理的h3元素,逐个点击,确保遍历每个代理。 - 页面跳转处理:进入详情页抓取数据后,调用
driver.back()返回列表页,保证后续循环在列表页执行。 - 显式等待元素加载:在详情页和返回列表页后,都添加显式等待,确保目标元素渲染完成后再操作,避免元素未找到的错误。
- 异常处理:对地址元素和点击操作添加异常捕获,避免单个代理处理失败导致整个程序崩溃。
- 移除无效的BeautifulSoup代码:直接在详情页通过Selenium抓取数据,无需再解析列表页源码(因为列表页没有详情页的元素)。
内容的提问来源于stack exchange,提问作者DaveMier88
相关产品推荐
相关产品推荐

