You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用PySpark读取本地文件?执行代码时遇文件未找到异常

PySpark读取本地CSV文件:解决文件未找到异常

当然可以用PySpark读取本地CSV文件,你的脚本出现文件未找到异常,可从以下几个方面排查解决:

  • 确认文件真实存在
    先通过系统命令验证路径是否正确:比如在Linux终端执行ls /home/file1.csv,如果返回文件不存在,说明路径写错了,要修正为实际的文件路径(比如/home/your_username/file1.csv)。Windows系统下路径格式要调整为file:///C:/your/path/file1.csv。

  • 检查文件读取权限
    运行PySpark的用户需要具备该文件的读取权限。在Linux下用ls -l /home/file1.csv查看权限,确保用户组或其他用户有读取(r)权限,若没有,可执行chmod +r /home/file1.csv添加权限。

  • 修正代码中的引号问题
    你的代码里使用了中文引号(“”、‘’),这会导致语法错误,必须替换为英文引号。正确代码如下:

    df = spark.read.format("csv").option("header", "true").load("file:///home/file1.csv")
    
  • 区分本地模式与集群模式
    如果是在集群环境运行PySpark,file://指向的是集群每个节点的本地文件,而非你提交任务的本地机器。这种情况要么把文件上传到HDFS(路径改为hdfs:///path/to/file1.csv),要么将文件同步到所有集群节点的相同路径下,或者使用共享存储挂载到所有节点。

内容的提问来源于stack exchange,提问作者user1768029

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.17 08:42:42