You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python的Scrapy从无class/src的<source>元素提取图片链接?

解决Scrapy提取元素图片链接的问题

问题分析

你当前代码存在两个核心问题:

  • CSS选择器语法错误:属性选择器需使用[属性名="值"]的格式,而非直接写media="..."
  • 提取了不存在的属性:目标<source>元素仅包含srcset属性,并无data-origin-srcset

修正后的代码

from urllib.parse import urljoin
import scrapy
from scrapy.crawler import CrawlerProcess
from scrapy.utils.project import get_project_settings
from datetime import datetime
import pandas as pd


class NewsSpider(scrapy.Spider):
    name = "simpleflying"

    def start_requests(self):
        url = input("Enter the article url: ")
        yield scrapy.Request(url, callback=self.parse_dir_contents)

    def parse_dir_contents(self, response):
        # 匹配指定media属性的source元素,提取srcset属性
        srcset_list = response.css('source[media="(min-width: 1024px)"]::attr(srcset)').getall()
        # 处理空列表情况,避免索引报错
        Feature_Image = srcset_list[0].strip() if srcset_list else None
        
        yield {
            'Feature_Image': Feature_Image,
        }

关键说明

  • 选择器source[media="(min-width: 1024px)"]精准定位目标<source>元素
  • 通过::attr(srcset)提取元素的图片链接属性
  • 增加空列表判断,防止网页结构变化时触发索引越界错误

内容的提问来源于stack exchange,提问作者Info Rewind

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.16 20:50:33