You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何XPATH在etenders.gov.za网站无法返回结果?求技术协助

问题分析与解决方案

核心原因

  • 动态渲染差异:etenders.gov.za的目标数据是通过JavaScript动态加载的,requests.get()只能获取初始静态HTML,无法获取JS渲染后的内容;而Formula1网站的目标数据直接包含在静态HTML中,所以原有方法有效。
  • XPATH路径偏差:浏览器开发者工具会自动补全<tbody>标签,但实际返回的静态HTML中可能不存在该标签,导致你的XPATH无法匹配到元素。

解决方案

方案1:模拟浏览器加载动态内容(推荐)

使用selenium模拟浏览器行为,获取完整渲染后的页面内容:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

url = "https://www.etenders.gov.za/Home/opportunities?id=1"
# 初始化浏览器驱动(需提前下载对应浏览器的驱动文件)
driver = webdriver.Chrome()
driver.get(url)

# 等待目标元素加载完成,避免因渲染延迟导致获取失败
wait = WebDriverWait(driver, 10)
target_element = wait.until(
    EC.presence_of_element_located((By.XPATH, '//*[@id="tendeList"]//tr[2]/td/table//tr[2]/td[1]/b'))
)

print(target_element.text)
print("----")

driver.quit()

方案2:修正XPATH并验证静态响应

先查看静态响应的实际HTML结构,再调整XPATH路径:

import requests
from lxml import etree

url = "https://www.etenders.gov.za/Home/opportunities?id=1"
webpage = requests.get(url)

# 可先打印响应文本,确认目标元素的实际位置
# print(webpage.text)

dom = etree.HTML(webpage.content)
# 移除浏览器自动补全的tbody标签,使用//匹配任意层级
res = dom.xpath('//*[@id="tendeList"]//tr[2]/td/table//tr[2]/td[1]/b/text()')
for i in res:
    print(i)
    print("----")

注意事项

  • 优先选择方案1,多数政府类网站依赖前端JS渲染数据,静态请求无法获取完整内容。
  • 调试XPATH时,直接查看requests.get()返回的原始HTML文本,不要依赖浏览器开发者工具的DOM结构——浏览器会自动修正不规范的HTML(如补全tbody、闭合标签等),导致实际响应与浏览器看到的DOM不一致。

内容的提问来源于stack exchange,提问作者AmandaMc

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.19 13:40:54