You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Selenium使用XPath爬取wunderground气象数据定位失败问题排查求助

问题排查点

  • XPath定位逻辑失效:你用//table[1]绝对位置索引的方式定位表格非常不稳定,页面头部的统计卡片、说明区块里的小型表格都会占用索引位,导致你定位到的根本不是承载逐半小时气象数据的目标表格。另外你写的元素层级和实际页面渲染后的结构也不匹配,自然匹配不到任何元素。
  • 旧版Selenium API兼容问题:find_elements_by_xpath是Selenium 3及更早版本的废弃API,如果你本地安装的是Selenium 4+版本,该方法已被移除,会直接返回空或者报错,需要改用find_elements(By.XPATH, 路径)的标准写法。
  • 硬等待不可靠:time.sleep(10)是固定时长等待,受网络波动、页面渲染速度影响极大,很可能10秒后目标表格还没完成渲染,此时定位自然返回空结果,应该替换成显式等待,确认目标元素加载完成后再执行定位操作。
  • 逻辑错误:你把driver.quit()放在了函数内部,调用一次函数后浏览器就会被关闭,后续如果需要多次调用函数拉取不同日期的数据会直接报错;另外循环从i=1开始会直接丢弃第一条观测数据。

修复后可运行代码

import pandas as pd
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

driver = webdriver.Chrome(executable_path='C:/Users/jdmba/chromedriver.exe')
Fromdate = '2018-01-1'

def Wheathertemp(date, driver):
    url = "https://www.wunderground.com/history/daily/gb/london/EGLC/date/"+date
    driver.get(url)
    # 显式等待,最多等20秒,直到目标表格加载出来
    wait = WebDriverWait(driver, 20)
    target_table = wait.until(EC.presence_of_element_located(
        (By.CSS_SELECTOR, 'table.mat-table.cdk-table.mat-sort')
    ))
    
    # 基于定位到的目标表格,往下找时间和温度列
    t = target_table.find_elements(By.XPATH, "./tbody/tr/td[1]//span[@class='wu-value wu-value-to']")
    temperature = target_table.find_elements(By.XPATH, "./tbody/tr/td[2]//span[@class='wu-value wu-value-to']")

    Wheather = []

    for i in range(len(temperature)):
        data = {'SP': str(i+1), 'timeObservation': t[i].text, 'temperature': temperature[i].text}
        Wheather.append(data)

    return Wheather


s = Wheathertemp(Fromdate, driver)
print(s)
# 所有数据拉取完成后再关闭浏览器
driver.quit()

内容的提问来源于stack exchange,提问作者Jose Batista

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 21:27:02