如何用Python Selenium获取div中图片的href链接?
问题描述
需要获取class为goods_descr_images的div内所有a标签的href属性(图片链接)并保存为文本,但尝试多种方法均无法成功访问这些href属性。对应的HTML结构如下:
<div class="goods_descr_images"> <a rel="prettyPhoto[pp_gal]" href="//www.xxx.com/preview/1202090/p1_4058391_c58ad212.jpg"></a> <a rel="prettyPhoto[pp_gal]" href="//www.xxx.com/preview/1202090/p1_4058391_0c39e11a.jpg"></a> <a rel="prettyPhoto[pp_gal]" href="//www.xxx.com/preview/1202090/p1_4058391_5ae0a383.jpg"></a> <a rel="prettyPhoto[pp_gal]" href="//www.xxx.com/preview/1202090/p1_4058391_99d6b754.jpg"></a> <a rel="prettyPhoto[pp_gal]" href="//www.xxx.com/preview/1202090/p1_4058391_5ae0a383.jpg"></a> <a rel="prettyPhoto[pp_gal]" href="//www.xxx.com/preview/1202090/p1_4058391_99d6b754.jpg"></a> <a rel="prettyPhoto[pp_gal]" href="//www.xxx.com/preview/1202090/p1_4058391_5ae0a383.jpg"></a> <a rel="prettyPhoto[pp_gal]" href="//www.xxx.com/preview/1202090/p1_4058391_99d6b754.jpg"></a></div>
解决方案代码
以下是Python Selenium的实现代码,可解决无法访问href属性的问题:
from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC # 初始化Chrome驱动(需确保ChromeDriver路径已配置到环境变量,或指定executable_path参数) driver = webdriver.Chrome() try: # 打开目标页面 driver.get("你的目标页面URL") # 显式等待目标div加载完成,最长等待10秒 wait = WebDriverWait(driver, 10) target_div = wait.until(EC.presence_of_element_located((By.CLASS_NAME, "goods_descr_images"))) # 获取div下所有a标签 a_elements = target_div.find_elements(By.TAG_NAME, "a") # 提取href属性,过滤空值并去重 image_links = list(set([elem.get_attribute("href") for elem in a_elements if elem.get_attribute("href")])) # 将链接写入文本文件 with open("image_links.txt", "w", encoding="utf-8") as file: for link in image_links: file.write(f"{link}\n") print(f"已成功提取并保存{len(image_links)}个唯一图片链接") finally: # 关闭浏览器 driver.quit()
关键注意点
- 用显式等待替代强制等待,确保页面元素完全渲染后再进行定位,避免因加载时序问题导致元素无法找到
- 使用
get_attribute("href")是Selenium获取元素属性的标准方式,可直接读取a标签的href值 - 加入去重逻辑,避免重复链接占用不必要的存储空间
内容的提问来源于stack exchange,提问作者Ömer FNz
相关产品推荐
相关产品推荐

