You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

eBay已售商品Selenium爬虫分页功能运行异常问题求助

eBay多页爬取异常修复方案

核心问题原因

  • 缩进语法错误:价格字段的try块、对应except块以及i=i+1的缩进位置错误,导致商品遍历循环仅执行1次就直接进入下一页点击逻辑
  • 下一页按钮定位错误:pagination__next icon-link是按钮的class属性值,不是name属性,且多类名不能直接用find_element_by_name定位
  • 商品字段定位逻辑错误:提取标题、价格时使用全局XPATH搭配自增索引i,相对路径写法错误,且i没有在每页爬取前重置,后续页面必然找不到对应元素
  • 异常捕获逻辑不合理:裸except会吞掉所有报错信息,无法定位具体问题
  • 冗余代码:requests.get(ebay_url)未被使用,可直接删除

修复后的可运行代码

import time
import pandas as pd
from selenium import webdriver as wd
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.common.exceptions import NoSuchElementException, TimeoutException

ebay_url = 'https://www.ebay.com/sch/i.html?_from=R40&_nkw=oakley+sunglasses&_sacat=0&Brand=Oakley&rt=nc&LH_Sold=1&LH_Complete=1&_ipg=200&_oaa=1&_fsrp=1&_dcat=79720'

driver = wd.Chrome(executable_path=r'/Users/mburley/Downloads/chromedriver')
driver.maximize_window()
driver.implicitly_wait(30)
driver.get(ebay_url)

wait = WebDriverWait(driver, 20)
all_sold_date = []
all_title = []
all_price = []

next_page = True
while next_page:
    # 等待当前页商品加载完成
    wait.until(EC.presence_of_all_elements_located((By.XPATH, "//div[contains(@class,'title--tagblock')]/span[@class='POSITIVE']")))
    sold_date = []
    title = []
    price = []
    
    for item in driver.find_elements(By.XPATH, "//div[contains(@class,'title--tagblock')]/span[@class='POSITIVE']"):
        try:
            sold_date.append(item.text)
        except NoSuchElementException:
            sold_date.append(None)
        
        try:
            # 从当前已售标签节点向上找父级节点,再定位对应标题
            title_node = item.find_element(By.XPATH, "./ancestor::div[contains(@class,'tag')]/following-sibling::a/h3")
            title.append(title_node.text)
        except NoSuchElementException:
            title.append(None)
        
        try:
            # 从当前已售标签节点向上找父级节点,再定位对应价格
            price_node = item.find_element(By.XPATH, "./ancestor::div[contains(@class,'tag')]/following-sibling::div[contains(@class,'details')]//span[@class='POSITIVE']")
            price.append(price_node.text)
        except NoSuchElementException:
            price.append(None)
    
    # 合并当前页数据到总数据
    all_sold_date.extend(sold_date)
    all_title.extend(title)
    all_price.extend(price)
    print(f"当前页爬取完成,累计已爬取{len(all_sold_date)}条数据")

    try:
        # 定位下一页按钮,存在就点击,不存在就退出循环
        next_btn = wait.until(EC.element_to_be_clickable((By.CSS_SELECTOR, 'a.pagination__next')))
        next_btn.click()
        print("已点击下一页,等待页面加载...")
        # 等待页面跳转完成
        time.sleep(2)
    except (NoSuchElementException, TimeoutException):
        print("已到最后一页,爬取结束")
        next_page = False

driver.quit()

# 生成导出数据
data = {
    'Sold_date': all_sold_date,
    'title': all_title,
    'price': all_price
} 
df = pd.DataFrame.from_dict(data)
df.to_csv('out_two.csv', index = 0)

优化说明

  • 移除了冗余的索引变量i,改为从已售标签节点直接相对定位对应商品的标题、价格,定位稳定性大幅提升
  • 拆分了单页临时存储和总数据存储,避免单页爬取失败影响全量数据
  • 替换了错误的下一页按钮定位逻辑,改用CSS选择器定位可点击的下一页按钮,增加加载等待避免点击失败
  • 替换了裸异常捕获,仅捕获和页面元素相关的指定异常,方便后续排查问题
  • 增加了页面加载等待逻辑,避免页面未加载完成就开始提取元素导致的报错

内容的提问来源于stack exchange,提问作者The_Bandit

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.07 13:51:00