PySpark:连接(|)后去除字段前导零的实现方法
在PySpark中去除分隔后字段的前导零
针对你的需求,核心思路是先拆分|分隔的字符串,处理第二个字段的前导零后,再重新拼接。以下是两种实用的实现方式:
方式一:用ltrim精准去除前导零
适合第二个字段可能包含非数字字符的场景,也能处理全零的特殊情况:
from pyspark.sql import SparkSession from pyspark.sql.functions import split, ltrim, concat_ws, col, when # 初始化Spark会话 spark = SparkSession.builder.appName("RemoveLeadingZeros").getOrCreate() # 构造测试数据 data = [ ("100|0000000086",), ("200|000000000087",), ("100|00000075",), ("300|00007505",) ] df = spark.createDataFrame(data, ["raw_str"]) # 处理逻辑 df_processed = df.withColumn("split_cols", split(col("raw_str"), "\\|")) \ .withColumn("first_col", col("split_cols")[0]) \ .withColumn("second_col", ltrim(col("split_cols")[1], "0")) \ # 若处理后为空(原字段全为0),则保留一个0 .withColumn("second_col", when(col("second_col") == "", "0").otherwise(col("second_col"))) \ .withColumn("processed_str", concat_ws("|", col("first_col"), col("second_col"))) \ .drop("split_cols", "first_col", "second_col") # 查看结果 df_processed.show(truncate=False)
方式二:转整数再转回字符串(仅适用于纯数字字段)
如果第二个字段确定是纯数字,这种方式更简洁,自动去除前导零:
from pyspark.sql import SparkSession from pyspark.sql.functions import split, concat_ws, col spark = SparkSession.builder.appName("RemoveLeadingZeros").getOrCreate() data = [ ("100|0000000086",), ("200|000000000087",), ("100|00000075",), ("300|00007505",) ] df = spark.createDataFrame(data, ["raw_str"]) df_processed = df.withColumn("split_cols", split(col("raw_str"), "\\|")) \ .withColumn("first_col", col("split_cols")[0]) \ # 转整数自动去前导零,再转回字符串 .withColumn("second_col", col("split_cols")[1].cast("integer").cast("string")) \ .withColumn("processed_str", concat_ws("|", col("first_col"), col("second_col"))) \ .drop("split_cols", "first_col", "second_col") df_processed.show(truncate=False)
两种方式最终都会输出你期望的结果:
+-------------+ |processed_str| +-------------+ |100|86 | |200|87 | |100|75 | |300|7505 | +-------------+
内容的提问来源于stack exchange,提问作者Ian_Yu
相关产品推荐
相关产品推荐

