PySpark:如何从DataFrame列提取带父文件夹的文件名
提取包含父文件夹的文件名(PySpark)
嘿,这个需求我之前处理过几次,给你分享两种实用的解法,直接在DataFrame上就能完成操作:
方法1:数组分割+切片拼接
这种方法逻辑直白,先把路径拆成数组,再精准截取最后两级内容拼回去:
from pyspark.sql.functions import split, slice, concat_ws, col # 新增目标列,提取父文件夹+文件名 data = data.withColumn( "parent_folder_filename", concat_ws("/", slice(split(col("sourcefile"), "/"), -2, 2)) )
逻辑拆解:
split(col("sourcefile"), "/"):把完整路径按斜杠拆成字符串数组,比如你的示例路径会变成["adl:", "", "dotdot.com", "ingest", "marketing", "abc.json"]slice(..., -2, 2):从数组倒数第2个元素开始,取2个元素,也就是["marketing", "abc.json"]concat_ws("/", ...):用斜杠把这两个元素拼接成最终的"marketing/abc.json"
方法2:正则表达式提取
如果你的路径格式比较固定,用正则会更简洁,直接匹配最后两级路径内容:
from pyspark.sql.functions import regexp_extract data = data.withColumn( "parent_folder_filename", regexp_extract(col("sourcefile"), r'\/([^\/]+\/[^\/]+)$', 1) )
正则说明:
\/:匹配路径中的斜杠([^\/]+\/[^\/]+):捕获组,专门匹配「非斜杠字符+斜杠+非斜杠字符」的组合,刚好对应父文件夹和文件名$:锚定字符串结尾,确保只取路径的最后两级
两种方法都能完美适配你的示例场景,选你觉得顺手的用就行~
内容的提问来源于stack exchange,提问作者Hemant Chandurkar
相关产品推荐
相关产品推荐

