You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

调用Scrapy的get_project_settings()时为何找不到代理列表文件?

问题原因及解决方法

核心问题:相对路径的工作目录不一致

命令行运行时,你通常是在scrapy.cfg所在的scraper目录下执行scrapy crawl命令,此时相对路径'proxylist'指向该目录下的文件,所以能正常找到。但通过脚本启动时,脚本的工作目录可能不是scraper目录(比如你在rascraper目录下运行脚本),导致Scrapy按照当前工作目录去查找proxylist,自然找不到。

解决方法

方法1:使用绝对路径(推荐)

修改settings.py,通过os模块动态生成代理文件的绝对路径,彻底摆脱对工作目录的依赖:

import os

# 获取settings.py所在目录的绝对路径
BASE_DIR = os.path.dirname(os.path.abspath(__file__))
# 拼接代理列表文件的绝对路径
ROTATING_PROXY_LIST_PATH = os.path.join(BASE_DIR, 'proxylist')

方法2:固定脚本运行的工作目录

在启动脚本中先切换到scraper目录,再初始化爬虫:

import os
from scrapy.crawler import CrawlerProcess
from scrapy.utils.project import get_project_settings

if __name__ == '__main__':
    # 切换到scraper目录(根据你的实际文件路径调整)
    os.chdir(os.path.join(os.path.dirname(__file__), 'scraper'))
    process = CrawlerProcess(get_project_settings())
    process.crawl('Acts', artist="eddiem")
    process.start()

或者运行脚本时,先手动进入scraper目录再执行:

cd rascraper/scraper
python your_script.py

额外检查点

  • 确认proxylist文件确实存在于scraper目录下,文件名无拼写错误
  • 确保proxylist文件有可读权限

内容的提问来源于stack exchange,提问作者AxelotlZ

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 00:38:12