使用Scrapy爬取ellenmacarthurfoundation网站返回空结果求助
解决Scrapy爬取ellenmacarthurfoundation文章链接的问题
针对你爬取目标页面文章链接的需求,原选择器返回空是因为页面元素结构已变化,以下是修正方案:
正确的CSS选择器
当前目标页面的文章条目被包裹在article.search-results__item标签内,其中的文章链接使用search-results__item-link类标识,使用以下代码即可获取所有文章链接:
links = response.css('article.search-results__item a.search-results__item-link::attr(href)').getall()
额外排查要点
如果执行后仍返回空结果,可按以下步骤排查:
- 先打印
response.text,确认响应内容是否包含目标页面的文章元素,避免请求错页面 - 若页面存在动态加载(滚动后加载更多文章),Scrapy默认的静态请求无法获取动态内容,此时需要结合
scrapy-playwright或scrapy-splash等工具渲染JavaScript后再爬取
内容的提问来源于stack exchange,提问作者Ignacio Perez vilaplana
相关产品推荐
相关产品推荐

