如何用Python的Scrapy从无class/src的<source>元素提取图片链接?
解决Scrapy提取 元素图片链接的问题
问题分析
你当前代码存在两个核心问题:
- CSS选择器语法错误:属性选择器需使用
[属性名="值"]的格式,而非直接写media="..." - 提取了不存在的属性:目标
<source>元素仅包含srcset属性,并无data-origin-srcset
修正后的代码
from urllib.parse import urljoin import scrapy from scrapy.crawler import CrawlerProcess from scrapy.utils.project import get_project_settings from datetime import datetime import pandas as pd class NewsSpider(scrapy.Spider): name = "simpleflying" def start_requests(self): url = input("Enter the article url: ") yield scrapy.Request(url, callback=self.parse_dir_contents) def parse_dir_contents(self, response): # 匹配指定media属性的source元素,提取srcset属性 srcset_list = response.css('source[media="(min-width: 1024px)"]::attr(srcset)').getall() # 处理空列表情况,避免索引报错 Feature_Image = srcset_list[0].strip() if srcset_list else None yield { 'Feature_Image': Feature_Image, }
关键说明
- 选择器
source[media="(min-width: 1024px)"]精准定位目标<source>元素 - 通过
::attr(srcset)提取元素的图片链接属性 - 增加空列表判断,防止网页结构变化时触发索引越界错误
内容的提问来源于stack exchange,提问作者Info Rewind
相关产品推荐
相关产品推荐

