Scrapy中如何丢弃Url2不符合规则的完整Item?
数据过滤逻辑的编写位置提示
- 若要在
middlewares.py中实现需求,优先选择SpiderMiddleware类下的process_spider_output方法:该方法会在爬虫解析页面生成包含name、url1、url2的Item后触发,可在此对每条Item的url2字段进行判断,直接剔除不符合条件的条目。 - 另一个可选位置是在
middlewares.py中自定义Item Pipeline类(需在Scrapy配置中启用),在其process_item方法内完成过滤:对不符合条件的Item抛出DropItem异常即可丢弃数据。
内容的提问来源于stack exchange,提问作者QuantumQuant
相关产品推荐
相关产品推荐

