You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Selenium遍历多元素时仅获取首行数据的问题求助

解决Selenium爬取仅获取第一行数据的问题

嘿,我帮你分析下这个问题——你遇到的循环只拿到第一行数据,大概率是几个常见的Selenium使用误区导致的,我给你拆解下解决方案:

最可能的核心原因:用了单个元素定位而非集合

如果你的代码里用的是find_element()方法,那它只会返回匹配到的第一个元素,自然只能拿到第一行数据。你需要换成find_elements(),这个方法会返回所有符合条件的元素集合,这样才能遍历所有行。

完整修复步骤与代码示例

1. 修正元素定位方式

先确认你是获取所有行的元素集合,而不是单个元素。比如假设页面里每行是一个表格行(<tr>),你可以这样写:

# 注意是find_elements,带s!
rows = driver.find_elements(By.XPATH, "//table//tr[not(contains(@class, 'header-row'))]")

2. 处理动态加载内容

很多这类商业网站是滚动加载的——只有当你滚动到页面底部,后面的行才会加载出来。所以你需要先模拟滚动,确保所有行都被加载:

# 滚动到页面底部,触发加载
driver.execute_script("window.scrollTo(0, document.body.scrollHeight);")
time.sleep(2)  # 给点时间让内容加载,也可以用更可靠的显式等待

3. 用显式等待替代固定sleep

固定sleep不够灵活,用Selenium的显式等待可以确保元素真正加载完成后再操作,避免因加载延迟导致的元素未找到问题:

from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

# 等待所有行元素出现,最多等15秒
wait = WebDriverWait(driver, 15)
rows = wait.until(EC.presence_of_all_elements_located((By.XPATH, "//table//tr[position()>1]")))

4. 完整可运行的修正代码

这里给你一个完整的参考代码,你可以根据页面实际结构调整元素定位的XPath:

import time
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

url = "https://finsight.com/product/us/abs/ee"

# 初始化浏览器,可添加无头模式和UA避免反爬
options = webdriver.ChromeOptions()
options.add_argument("--headless=new")
options.add_argument("user-agent=Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36")
driver = webdriver.Chrome(options=options)

try:
    driver.get(url)
    
    # 滚动加载所有内容
    driver.execute_script("window.scrollTo(0, document.body.scrollHeight);")
    time.sleep(3)
    
    # 等待所有行加载完成
    wait = WebDriverWait(driver, 15)
    rows = wait.until(EC.presence_of_all_elements_located((By.XPATH, "//table//tr[position()>1]")))
    
    # 遍历每一行提取数据
    for row in rows:
        # 提取类型(AUTO/CBMS),根据实际列位置调整td的索引
        item_type = row.find_element(By.XPATH, "./td[1]").text.strip()
        # 提取公司名称
        company_name = row.find_element(By.XPATH, "./td[2]").text.strip()
        # 提取下载链接
        download_url = row.find_element(By.XPATH, "./td//a[@href]").get_attribute("href")
        
        print(f"类型: {item_type}, 公司名称: {company_name}, 下载链接: {download_url}")
        
finally:
    # 关闭浏览器
    driver.quit()

关键提醒

  • 你需要用浏览器开发者工具(F12)查看页面的真实DOM结构,调整XPath或选择器,确保能准确定位到每行的元素。
  • 如果网站有反爬限制,可能需要添加更多的反反爬策略,比如随机等待时间、更换IP等,但一般这类商业网站不会太严格。

内容的提问来源于stack exchange,提问作者arsenal123

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.22 09:49:03