You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Selenium爬取房产代理数据遇NoSuchElementException报错排查

代码问题排查与修复方案

核心问题点

  • 重复点击同一元素:循环中driver.find_element(By.TAG_NAME, "h3").click()每次只会定位页面第一个h3标签,无法遍历25个代理的链接,导致后续操作全在同一个详情页重复执行。
  • 未处理页面跳转与返回:点击进入详情页后,没有回到列表页,后续循环仍在详情页执行,自然找不到列表页的元素,逻辑完全混乱。
  • 未等待详情页元素加载:进入详情页后直接查找my_map_adress元素,没有等待页面渲染完成,大概率因为元素未加载触发NoSuchElementException。
  • BeautifulSoup逻辑完全错误:试图在列表页的HTML源码中提取详情页的h1和my_map_adress元素,这两个元素仅存在于详情页,列表页根本没有,此部分代码完全无效;同时判断条件中混淆了class和id属性,agent.find({'class': 'my_map_adress'})与目标元素的id不匹配。

修复后的代码

from bs4 import BeautifulSoup
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.support.ui import WebDriverWait

elemental_list = []

driver = webdriver.Chrome()

for page in range(1, 21):
    page_url = f"https://www.fastexpert.com/top-real-estate-agents/florida/?page={page}"
    driver.get(page_url)
    # 等待列表页所有代理卡片加载完成
    WebDriverWait(driver, 20).until(
        EC.presence_of_all_elements_located((By.CSS_SELECTOR, "div.TOPREPT_RRT h3"))
    )
    # 获取当前页所有代理的h3元素(链接)
    agent_links = driver.find_elements(By.CSS_SELECTOR, "div.TOPREPT_RRT h3")
    
    for link in agent_links[:25]:  # 确保只处理前25个代理
        try:
            link.click()  # 点击进入详情页
            # 等待详情页姓名元素加载
            WebDriverWait(driver, 20).until(
                EC.presence_of_element_located((By.TAG_NAME, "h1"))
            )
            # 尝试获取地址元素,处理不存在的情况
            try:
                address = driver.find_element(By.ID, "my_map_adress").text.strip()
            except:
                address = ""
            name = driver.find_element(By.TAG_NAME, "h1").text.strip()
            elemental_list.append((name, address))
            driver.back()  # 返回列表页
            # 等待列表页代理链接重新加载
            WebDriverWait(driver, 20).until(
                EC.presence_of_all_elements_located((By.CSS_SELECTOR, "div.TOPREPT_RRT h3"))
            )
            # 重新获取代理链接列表(因为页面返回后元素状态可能变化)
            agent_links = driver.find_elements(By.CSS_SELECTOR, "div.TOPREPT_RRT h3")
        except Exception as e:
            print(f"处理代理时出错: {e}")
            driver.back()  # 出错时确保返回列表页
            continue

# 打印结果
for item in elemental_list:
    print(item)

driver.quit()

修复说明

  1. 遍历所有代理链接:通过find_elements获取当前页所有代理的h3元素,逐个点击,确保遍历每个代理。
  2. 页面跳转处理:进入详情页抓取数据后,调用driver.back()返回列表页,保证后续循环在列表页执行。
  3. 显式等待元素加载:在详情页和返回列表页后,都添加显式等待,确保目标元素渲染完成后再操作,避免元素未找到的错误。
  4. 异常处理:对地址元素和点击操作添加异常捕获,避免单个代理处理失败导致整个程序崩溃。
  5. 移除无效的BeautifulSoup代码:直接在详情页通过Selenium抓取数据,无需再解析列表页源码(因为列表页没有详情页的元素)。

内容的提问来源于stack exchange,提问作者DaveMier88

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.15 12:35:40