You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用BeautifulSoup无法定位img标签,求网页图片链接爬取方案

解决Eaton产品页面图片爬取失败的问题

问题原因

你爬取的页面采用了懒加载机制:图片的真实地址并不存放在src属性中,而是存储在data-src这类自定义属性里;另外页面部分内容可能由JavaScript动态渲染,直接用BeautifulSoup请求静态HTML源码,无法获取到完整的图片元素结构。

修正后的爬取方案

方案1:读取懒加载属性(适用于静态源码可见图片元素的情况)

直接修改代码读取图片的data-src属性:

# 方法1:用select_one定位并获取data-src
img_elem = soup.select_one('.module-media-gallery__image.lazyload')
if img_elem:
    print(img_elem.get('data-src'))

# 方法2:用find定位并获取data-src
img_elem = soup.find('img', class_='module-media-gallery__image lazyload')
if img_elem:
    print(img_elem.get('data-src'))

方案2:处理动态渲染内容(适用于静态源码无图片元素的情况)

如果静态HTML里找不到图片元素,说明内容是JS动态加载的,需要用浏览器模拟工具加载页面:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

# 初始化浏览器驱动
driver = webdriver.Chrome()
driver.get("https://www.eaton.com/us/en-us/skuPage.101012%2520G.html")

# 等待图片元素加载完成
img_elem = WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.CSS_SELECTOR, '.module-media-gallery__image.lazyload'))
)

# 此时懒加载已触发,直接获取src属性即可拿到真实地址
print(img_elem.get_attribute('src'))

# 关闭浏览器
driver.quit()

额外提示

  • 爬取时建议添加User-Agent请求头,模拟正常浏览器访问
  • 避免频繁请求,防止IP被网站封禁

内容的提问来源于stack exchange,提问作者Bar oo.

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 08:53:11