You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Selectorlib预览可显示阿里产品图链接但Scrapy爬虫无法正常提取

问题原因

阿里巴巴搜索结果页采用图片懒加载策略,你在Chrome开发者工具、Selectorlib扩展里看到的src属性是页面加载完成、图片进入视口后浏览器动态替换后的结果,而Scrapy直接请求拿到的是未经过浏览器渲染的原始HTML,未触发懒加载的图片src属性为占位的1px透明图,真实的图片链接存储在data-src自定义属性中。

解决方法

修改Selectorlib yaml配置中Image字段的attribute取值,将src替换为data-src即可,修改后的对应配置段如下:

Image:
    css: img.J-img-switcher-item
    xpath: null
    type: Attribute
    attribute: data-src

补充注意事项

  • 提取到的图片链接为//开头的无协议链接,使用前可拼接https:前缀转为完整可访问链接
  • 发起请求时建议添加标准浏览器的User-Agent请求头,避免站点返回异常结构的页面影响提取效果

内容的提问来源于stack exchange,提问作者Thomas Batelaan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 02:36:05