You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark:如何从DataFrame列提取带父文件夹的文件名

提取包含父文件夹的文件名(PySpark)

嘿,这个需求我之前处理过几次,给你分享两种实用的解法,直接在DataFrame上就能完成操作:

方法1:数组分割+切片拼接

这种方法逻辑直白,先把路径拆成数组,再精准截取最后两级内容拼回去:

from pyspark.sql.functions import split, slice, concat_ws, col

# 新增目标列,提取父文件夹+文件名
data = data.withColumn(
    "parent_folder_filename",
    concat_ws("/", slice(split(col("sourcefile"), "/"), -2, 2))
)

逻辑拆解:

  • split(col("sourcefile"), "/"):把完整路径按斜杠拆成字符串数组,比如你的示例路径会变成["adl:", "", "dotdot.com", "ingest", "marketing", "abc.json"]
  • slice(..., -2, 2):从数组倒数第2个元素开始,取2个元素,也就是["marketing", "abc.json"]
  • concat_ws("/", ...):用斜杠把这两个元素拼接成最终的"marketing/abc.json"

方法2:正则表达式提取

如果你的路径格式比较固定,用正则会更简洁,直接匹配最后两级路径内容:

from pyspark.sql.functions import regexp_extract

data = data.withColumn(
    "parent_folder_filename",
    regexp_extract(col("sourcefile"), r'\/([^\/]+\/[^\/]+)$', 1)
)

正则说明:

  • \/:匹配路径中的斜杠
  • ([^\/]+\/[^\/]+):捕获组,专门匹配「非斜杠字符+斜杠+非斜杠字符」的组合,刚好对应父文件夹和文件名
  • $:锚定字符串结尾,确保只取路径的最后两级

两种方法都能完美适配你的示例场景,选你觉得顺手的用就行~

内容的提问来源于stack exchange,提问作者Hemant Chandurkar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.28 04:19:38