You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Selenium无法爬取韦拉克鲁斯港船舶数据的解决方案咨询

解决Selenium爬取Veracruz港口船舶数据的问题

核心问题分析

你之前定位的gridSimpleFiltering_footer_container是表格的页脚容器,并非数据行所在区域,自然无法提取到目标数据。正确的定位需要指向表格的tbody内的数据行(tr元素),再提取对应列的内容。

具体实现步骤(Python示例)

  1. 导入依赖库
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
  1. 初始化浏览器并等待表格加载
    页面数据是动态渲染的,必须用显式等待确保元素加载完成,避免出现找不到元素的情况:
driver = webdriver.Chrome()
driver.get("https://www.puertodeveracruz.com.mx/datosBuques/principal.php?jmlp=1")

# 等待表格数据行加载完成,超时时间设置为10秒
wait = WebDriverWait(driver, 10)
data_rows = wait.until(EC.presence_of_all_elements_located((By.XPATH, "//table[@id='gridSimpleFiltering']/tbody/tr")))
  1. 遍历行提取目标列
    根据页面表头顺序,Viaje对应第1列(td索引0)、Nombre Buque对应第2列(td索引1)、Fecha ETA对应第4列(td索引3):
for row in data_rows:
    # 提取每列文本并去除多余空格
    viaje = row.find_element(By.XPATH, "./td[1]").text.strip()
    nombre_buque = row.find_element(By.XPATH, "./td[2]").text.strip()
    fecha_eta = row.find_element(By.XPATH, "./td[4]").text.strip()
    
    # 输出或存储数据
    print(f"Viaje: {viaje} | Nombre Buque: {nombre_buque} | Fecha ETA: {fecha_eta}")
  1. 关闭浏览器
driver.quit()

额外提示

  • 如果需要爬取多页数据,可定位分页按钮(如“下一页”),循环点击并重复提取逻辑,注意处理分页加载的等待。
  • 若遇到元素定位失败,可通过浏览器开发者工具(F12)查看元素实际结构,调整xpath或CSS选择器的准确性。

内容的提问来源于stack exchange,提问作者Amadeus

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.19 08:55:19