Selenium使用XPath爬取wunderground气象数据定位失败问题排查求助
问题排查点
- XPath定位逻辑失效:你用
//table[1]绝对位置索引的方式定位表格非常不稳定,页面头部的统计卡片、说明区块里的小型表格都会占用索引位,导致你定位到的根本不是承载逐半小时气象数据的目标表格。另外你写的元素层级和实际页面渲染后的结构也不匹配,自然匹配不到任何元素。 - 旧版Selenium API兼容问题:
find_elements_by_xpath是Selenium 3及更早版本的废弃API,如果你本地安装的是Selenium 4+版本,该方法已被移除,会直接返回空或者报错,需要改用find_elements(By.XPATH, 路径)的标准写法。 - 硬等待不可靠:
time.sleep(10)是固定时长等待,受网络波动、页面渲染速度影响极大,很可能10秒后目标表格还没完成渲染,此时定位自然返回空结果,应该替换成显式等待,确认目标元素加载完成后再执行定位操作。 - 逻辑错误:你把
driver.quit()放在了函数内部,调用一次函数后浏览器就会被关闭,后续如果需要多次调用函数拉取不同日期的数据会直接报错;另外循环从i=1开始会直接丢弃第一条观测数据。
修复后可运行代码
import pandas as pd from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC driver = webdriver.Chrome(executable_path='C:/Users/jdmba/chromedriver.exe') Fromdate = '2018-01-1' def Wheathertemp(date, driver): url = "https://www.wunderground.com/history/daily/gb/london/EGLC/date/"+date driver.get(url) # 显式等待,最多等20秒,直到目标表格加载出来 wait = WebDriverWait(driver, 20) target_table = wait.until(EC.presence_of_element_located( (By.CSS_SELECTOR, 'table.mat-table.cdk-table.mat-sort') )) # 基于定位到的目标表格,往下找时间和温度列 t = target_table.find_elements(By.XPATH, "./tbody/tr/td[1]//span[@class='wu-value wu-value-to']") temperature = target_table.find_elements(By.XPATH, "./tbody/tr/td[2]//span[@class='wu-value wu-value-to']") Wheather = [] for i in range(len(temperature)): data = {'SP': str(i+1), 'timeObservation': t[i].text, 'temperature': temperature[i].text} Wheather.append(data) return Wheather s = Wheathertemp(Fromdate, driver) print(s) # 所有数据拉取完成后再关闭浏览器 driver.quit()
内容的提问来源于stack exchange,提问作者Jose Batista
相关产品推荐
相关产品推荐

