PySpark如何从路径字符串中提取指定层级的目录名称
PySpark 提取路径指定目录段实现方案
前置准备
首先构造示例测试用的DataFrame,你可以根据自己的实际数据集替换对应列名即可:
from pyspark.sql import SparkSession from pyspark.sql.functions import split, col, expr, regexp_replace # 初始化SparkSession spark = SparkSession.builder.appName("path_extract_demo").getOrCreate() # 构造示例路径数据 test_data = [("Aw/Bt/Ce/Dr",), ("/Usr/Bt/Project/Log",), ("Ab/Cd/Bt/Output",)] df = spark.createDataFrame(test_data, ["cwd_path"]) df.show(truncate=False)
示例输出:
+-------------------+ |cwd_path | +-------------------+ |Aw/Bt/Ce/Dr | |/Usr/Bt/Project/Log| |Ab/Cd/Bt/Output | +-------------------+
方案1:目标目录段位置固定
如果你确认Bt永远是路径的第2个层级(按/分割后索引从0计数的第1位),直接拆分数组取对应索引即可:
# 先预处理去除路径首尾的斜杠,避免开头/导致索引偏移 df = df.withColumn("clean_path", regexp_replace(col("cwd_path"), "^/|/$", "")) \ .withColumn("target_dir", split(col("clean_path"), "/").getItem(1)) df.select("cwd_path", "target_dir").show(truncate=False)
输出结果:
+-------------------+----------+ |cwd_path |target_dir| +-------------------+----------+ |Aw/Bt/Ce/Dr |Bt | |/Usr/Bt/Project/Log|Bt | |Ab/Cd/Bt/Output |Cd | +-------------------+----------+
方案2:目标目录段位置不固定,需匹配值为Bt的段
如果路径层级不固定,只需要提取所有目录段中值等于Bt的部分,用数组过滤逻辑实现:
df = df.withColumn("clean_path", regexp_replace(col("cwd_path"), "^/|/$", "")) \ .withColumn("path_segments", split(col("clean_path"), "/")) \ # 过滤出值为Bt的段,取第一个匹配结果 .withColumn("target_dir", expr("filter(path_segments, seg -> seg = 'Bt')[0]")) df.select("cwd_path", "target_dir").show(truncate=False)
输出结果:
+-------------------+----------+ |cwd_path |target_dir| +-------------------+----------+ |Aw/Bt/Ce/Dr |Bt | |/Usr/Bt/Project/Log|Bt | |Ab/Cd/Bt/Output |Bt | +-------------------+----------+
- 扩展说明:如果需要模糊匹配包含
Bt的目录段,只需要把filter的条件改成seg -> seg like '%Bt%'即可。
内容的提问来源于stack exchange,提问作者Jagan
相关产品推荐
相关产品推荐

