PySpark按最后一个斜杠将文件路径字符串列拆分为两列
PySpark 按最后一个斜杠拆分文件全路径实现方案
核心规则:不依赖硬编码位置,统一以字符串中最后一个/为分界拆分,文件名取最后一个/后的内容,路径前缀取最后一个/及之前的内容。
以下两种方案均使用Spark原生内置函数实现,性能远高于自定义UDF,可直接在生产环境使用。
前置准备
先导入依赖函数、构造测试数据集:
from pyspark.sql import SparkSession from pyspark.sql.functions import col, substring_index, substring, length, reverse, instr, expr spark = SparkSession.builder.appName("split_file_path").getOrCreate() # 匹配提问中的示例输入 test_dataset = [ ("/level1/level2/level3/file1.ext",), ("/level1/file1000.ext",), ("/level1/level2/file20.ext",) ] source_df = spark.createDataFrame(test_dataset, ["file name"])
方案1:substring_index 极简实现
代码可读性最高,逻辑最简洁,优先推荐使用。
核心逻辑:
- 用
substring_index(col, '/', -1)直接取最后一个/后的内容作为文件名 - 计算原字符串总长度减去文件名长度,从首位截取对应长度的子串,就是带末尾斜杠的路径前缀
实现代码:
result_df = source_df.withColumn( "file_name", substring_index(col("file name"), "/", -1) ).withColumn( "path", expr("substring(`file name`, 1, length(`file name`) - length(file_name))") ).drop("file name").withColumnRenamed("file_name", "file name").select("file name", "path")
方案2:定位最后斜杠位置截取
适合需要明确获取分隔符位置做后续扩展逻辑的场景。
核心逻辑:
- 将原字符串反转,查找反转后第一个
/的位置,反推得到原字符串中最后一个/的下标 - 按下标位置分别截取路径前缀、文件名两段
实现代码:
result_df = source_df.withColumn( "last_slash_index", length(col("file name")) - instr(reverse(col("file name")), "/") + 1 ).withColumn( "path", substring(col("file name"), 1, col("last_slash_index")) ).withColumn( "file_name", substring(col("file name"), col("last_slash_index") + 1, length(col("file name"))) ).drop("file name", "last_slash_index").withColumnRenamed("file_name", "file name").select("file name", "path")
结果验证
两种方案执行后输出完全匹配需求:
| file name | path |
|---|---|
| file1.ext | /level1/level2/level3/ |
| file1000.ext | /level1/ |
| file20.ext | /level1/level2/ |
注意:不建议使用Python UDF实现该逻辑,Spark原生函数支持全阶段代码生成,大数据量下性能是Python UDF的10~100倍。
内容的提问来源于stack exchange,提问作者bda
相关产品推荐
相关产品推荐

