Selectorlib预览可显示阿里产品图链接但Scrapy爬虫无法正常提取
问题原因
阿里巴巴搜索结果页采用图片懒加载策略,你在Chrome开发者工具、Selectorlib扩展里看到的src属性是页面加载完成、图片进入视口后浏览器动态替换后的结果,而Scrapy直接请求拿到的是未经过浏览器渲染的原始HTML,未触发懒加载的图片src属性为占位的1px透明图,真实的图片链接存储在data-src自定义属性中。
解决方法
修改Selectorlib yaml配置中Image字段的attribute取值,将src替换为data-src即可,修改后的对应配置段如下:
Image: css: img.J-img-switcher-item xpath: null type: Attribute attribute: data-src
补充注意事项
- 提取到的图片链接为
//开头的无协议链接,使用前可拼接https:前缀转为完整可访问链接 - 发起请求时建议添加标准浏览器的User-Agent请求头,避免站点返回异常结构的页面影响提取效果
内容的提问来源于stack exchange,提问作者Thomas Batelaan
相关产品推荐
相关产品推荐

