使用PySpark将SharePoint二进制文件复制到OneLake遇阻求助
解决PySpark写入OneLake时的FileNotFoundError问题
可能原因及对应解决方案
1. 路径格式不符合PySpark要求
PySpark访问OneLake必须使用ABFS标准路径格式,不能用门户显示的普通路径或本地路径。正确格式示例:
abfss://<工作区名称>@onelake.dfs.fabric.microsoft.com/<湖仓名称>/Files/<目标文件夹路径>/<文件名>.xlsx
注意:工作区、湖仓名称区分大小写,需与Fabric门户完全匹配,且确认湖仓已创建并处于可用状态。
2. 权限配置缺失
- 确认运行Notebook的身份(或Entra ID应用)拥有OneLake目标文件夹的写入权限(至少为湖仓的Contributor角色)。
- 若使用服务主体,需在Fabric工作区中给该主体添加对应权限,仅在Entra ID配置无效。
3. 二进制写入API选择错误
PySpark常规spark.write API针对结构化数据,不适合直接写入二进制文件,推荐两种可行方式:
方式一:复用notebookutils写入(简单直接)
既然你已验证notebookutils读写文本正常,直接用它处理二进制流:
from notebookutils import mssparkutils # 假设已从SharePoint获取二进制数据file_content(bytes类型) target_path = "abfss://工作区名称@onelake.dfs.fabric.microsoft.com/湖仓名称/Files/目标文件夹/test.xlsx" mssparkutils.fs.put(target_path, bytearray(file_content), overwrite=True)
方式二:用BinaryFileWriter批量处理
如果需要批量操作,可将二进制数据包装为DataFrame后写入:
from pyspark.sql import Row from pyspark.sql.types import StructType, StructField, BinaryType, StringType # 构造包含文件名和二进制内容的DataFrame data = [Row(file_name="test.xlsx", content=file_content)] schema = StructType([ StructField("file_name", StringType(), nullable=False), StructField("content", BinaryType(), nullable=False) ]) df = spark.createDataFrame(data, schema) # 写入OneLake指定路径 df.write.format("binaryFile") \ .option("path", "abfss://工作区名称@onelake.dfs.fabric.microsoft.com/湖仓名称/Files/目标文件夹/") \ .option("fileName", "test.xlsx") \ .mode("overwrite") \ .save()
4. 路径含特殊字符未处理
若路径包含空格或特殊字符,需确保路径被正确识别,示例:
# 含空格的路径写法 target_path = "abfss://我的工作区@onelake.dfs.fabric.microsoft.com/我的湖仓/Files/我的文件夹/test.xlsx"
验证步骤
- 先列出目标路径确认文件夹存在:
mssparkutils.fs.ls("abfss://工作区名称@onelake.dfs.fabric.microsoft.com/湖仓名称/Files/目标文件夹/")
- 写入测试二进制数据,排除SharePoint数据本身问题:
test_content = b"test binary content" mssparkutils.fs.put(target_path, bytearray(test_content), overwrite=True)
内容的提问来源于stack exchange,提问作者maclura
相关产品推荐
相关产品推荐

