You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy管道报“NoneType”无__getitem__属性错误及双管道配置求助

解决Scrapy管道报错:'NoneType' object has no attribute 'getitem'

这个错误我太熟了!大概率是你的图片管道(ImgPipeline)没有正确返回item对象,导致后续的文件管道拿到的是None,当它尝试访问item['file_urls']时就触发了这个报错。咱们一步步排查解决:

1. 优先检查图片管道的process_item方法

这是最常见的问题点:如果你的ImgPipeline在处理完item后没有返回item,而是返回了None(或者压根没写return),那么下一个优先级的管道(FilesPipeline)收到的参数就是None,自然没法用__getitem__(也就是[])去取字段。

正确的写法示例:

def process_item(self, item, spider):
    # 你的图片处理逻辑,比如下载、校验等
    # ...
    
    # 一定要记得返回item!!!
    return item

如果需要丢弃不符合要求的item,别返回None,要抛出DropItem异常:

from scrapy.exceptions import DropItem

def process_item(self, item, spider):
    if not item.get('image_urls'):
        raise DropItem("跳过无图片URL的item")
    
    # 处理逻辑
    return item

2. 修正爬虫里的字段赋值逻辑

你写的if len(self.img_) >= 0:完全没起到过滤作用——空列表的长度就是0,这个条件永远为真。如果self.img_是None的话,还会直接触发TypeError。改成下面的判断更合理:

# 先判断self.img_不是None,且不为空列表
if self.img_:
    item['image_urls'] = self.img_

# 文件字段同理
if self.result:
    item['file_urls'] = self.result

另外,建议在爬虫初始化的时候把self.img_和self.result初始化为空列表,避免它们变成None:

def __init__(self):
    self.img_ = []
    self.result = []

3. 调试小技巧

如果还是不确定问题在哪,在每个管道的process_item开头加个打印,看看item到底是什么:

def process_item(self, item, spider):
    print(f"当前管道处理的item: {item}")
    # 后续逻辑
    return item

这样就能直观看到是不是某个管道把item变成None了。

内容的提问来源于stack exchange,提问作者user2521546

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 04:22:14