You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy项目CSV转XLSX时文件未生成问题求助

解决Scrapy爬虫完成后CSV转XLSX时机问题+优化方案

嘿,我来帮你搞定这个问题!你遇到的核心问题是Scrapy爬虫还没跑完生成CSV文件,转换函数就提前执行了,sleep没用是因为你没法精准预估爬虫的运行时间。下面分两步给你解决:

一、先解决当前的文件生成时机问题

Scrapy的CrawlerProcess.start()默认是阻塞式的——也就是说,它会一直等到所有爬虫任务完全结束才会返回主线程。如果你之前的代码里用了process.start(False)(非阻塞模式),或者没有正确等待爬虫完成,就会出现转换函数提前执行的情况。

修正后的main.py代码应该是这样的:

from scrapy.crawler import CrawlerProcess
from spiders import my_spider
# 假设你的转换函数在exporter模块里
from exporter import csv_2_xlsx

FILE_NAME = "output.csv"

def run_spider():
    # 配置Scrapy的FEEDS,确保CSV文件正确生成
    process = CrawlerProcess(settings={
        "FEEDS": {
            FILE_NAME: {
                "format": "csv",
                "encoding": "utf-8",
                "overwrite": True  # 覆盖已有文件,避免旧数据干扰
            }
        },
        # 其他Scrapy配置,比如ROBOTSTXT_OBEY等
    })
    process.crawl(my_spider.MySpider)
    # 这里用默认的start(),会阻塞主线程直到爬虫结束
    process.start()

if __name__ == "__main__":
    # 先跑爬虫,等完全结束后再执行转换
    run_spider()
    # 现在CSV文件已经100%生成了,放心转换
    csv_2_xlsx(FILE_NAME)

另外可以检查下CSV文件的路径:如果用相对路径,确认它生成在你预期的目录下(比如和main.py同目录),避免找错文件。

二、优化方案:直接导出XLSX,跳过CSV转换步骤

其实完全没必要绕CSV转一圈,Scrapy支持直接导出XLSX,有两种简单方法:

方法1:用第三方库scrapy-xlsx(最省心)

先安装库:

pip install scrapy-xlsx

然后在你的Scrapy项目的settings.py里配置FEEDS:

FEEDS = {
    "output.xlsx": {
        "format": "xlsx",
        "encoding": "utf-8",
        "overwrite": True
    }
}

启动爬虫后,直接就生成XLSX文件了,一步到位!

方法2:自定义XLSX Exporter(不用第三方库)

如果你不想依赖第三方库,可以自己写一个简单的Exporter,用openpyxl实现:

  1. 在你的项目根目录新建exporters.py文件:
from scrapy.exporters import BaseItemExporter
from openpyxl import Workbook

class XlsxItemExporter(BaseItemExporter):
    def __init__(self, file, **kwargs):
        super().__init__(**kwargs)
        self.file = file
        self.wb = Workbook()
        self.ws = self.wb.active
        self.headers_written = False

    def export_item(self, item):
        # 第一次导出时先写表头
        if not self.headers_written:
            self.ws.append(item.keys())
            self.headers_written = True
        # 写入数据行
        self.ws.append(item.values())

    def finish_exporting(self):
        # 保存文件
        self.wb.save(self.file)
  1. 在settings.py里配置FEED_EXPORTERS和FEEDS:
FEED_EXPORTERS = {
    'xlsx': 'your_project_name.exporters.XlsxItemExporter',
}

FEEDS = {
    "output.xlsx": {
        "format": "xlsx",
        "overwrite": True
    }
}

这样也能直接生成XLSX文件,完全不需要转换。

额外优化你的CSV转XLSX函数

如果之后还是需要用到CSV转XLSX,用pandas会比自己写更简洁稳定:

import pandas as pd

def csv_2_xlsx(csv_file):
    # 读取CSV
    df = pd.read_csv(csv_file, encoding='utf-8')
    # 导出为XLSX,自动替换后缀
    df.to_excel(csv_file.replace('.csv', '.xlsx'), index=False)

记得先安装依赖:

pip install pandas openpyxl

内容的提问来源于stack exchange,提问作者Freddy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 06:34:06