Selenium访问网页异常求助:无法获取'enlaces'类标题
解决方案:处理HTTPS提示并提取'enlaces'元素标题
问题分析
核心问题是浏览器访问目标站点时触发HTTPS安全提示(如证书不信任),导致页面未完全加载,进而无法定位到目标元素。以下是针对性解决步骤和优化后的代码:
解决步骤
- 忽略证书错误:通过Chrome配置跳过证书验证,避免安全提示拦截页面加载
- 使用显式等待:替代固定
sleep(),确保元素加载完成后再提取,提升稳定性 - 简化代码逻辑:直接用Selenium定位元素,无需混合BeautifulSoup,减少冗余依赖
优化后的代码
from selenium import webdriver from selenium.webdriver.chrome.service import Service from selenium.webdriver.chrome.options import Options from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from webdriver_manager.chrome import ChromeDriverManager import unittest class DOFScraper(unittest.TestCase): def setUp(self): # 配置Chrome选项,忽略证书相关错误 chrome_options = Options() chrome_options.add_argument('--ignore-certificate-errors') chrome_options.add_argument('--ignore-ssl-errors') # 初始化浏览器实例 self.driver = webdriver.Chrome( service=Service(ChromeDriverManager().install()), options=chrome_options ) self.driver.get("https://dof.gob.mx") def test_extract_enlaces(self): driver = self.driver # 显式等待目标元素加载完成,最长等待10秒 WebDriverWait(driver, 10).until( EC.presence_of_all_elements_located((By.CLASS_NAME, "enlaces")) ) # 提取所有'enlaces'元素的文本内容 enlaces_list = driver.find_elements(By.CLASS_NAME, "enlaces") for item in enlaces_list: print(item.text.strip()) def tearDown(self): self.driver.quit() if __name__ == '__main__': unittest.main(verbosity=2)
额外说明
如果页面存在隐私政策同意弹窗等其他拦截元素,可在setUp()中添加对应点击操作,示例如下(需根据实际元素定位调整):
# 等待并点击隐私同意按钮 WebDriverWait(driver, 5).until( EC.element_to_be_clickable((By.ID, "accept-privacy-btn")) ).click()
内容的提问来源于stack exchange,提问作者Guillermo Montaño Medina
相关产品推荐
相关产品推荐

