如何在Spark Dataset中转换字符串为数值?并替换\N为0.0解决异常
嘿,这两个Spark的问题我刚好有经验,给你梳理下解决方案~
一、Spark Dataset中将字符串值转换为整数
根据字符串是否存在非法值,有两种常用处理方式:
- 直接强制转换:如果能保证所有字符串都是合法整数,直接用
cast方法转换即可:import org.apache.spark.sql.functions.col import org.apache.spark.sql.types.IntegerType // 方式1:用字符串类型标识 val convertedDf = originalDf.withColumn("int_column", col("string_column").cast("integer")) // 方式2:用IntegerType类型对象 val convertedDf = originalDf.withColumn("int_column", col("string_column").cast(IntegerType)) - 处理转换失败场景:如果字符串可能包含非整数值,转换后会得到
null,可以用try_cast(Spark 2.2及以上支持)配合otherwise来替换默认值:import org.apache.spark.sql.functions.{try_cast, when} // 转换失败时返回0作为默认值 val convertedDf = originalDf.withColumn("int_column", try_cast(col("string_column").cast("integer")).otherwise(0) )
二、将Dataset中的"\N"替换为0.0
你的场景里,因为Schema定义了value为非空DoubleType,但CSV中的\N无法被解析为合法Double,导致读取报错。这里有两种靠谱的解决思路:
方法1:读取时指定空值标记
利用Spark CSV读取器的nullValue参数,把\N识别为null,之后再将null替换为0.0:
import org.apache.spark.sql.types.{StructType, StructField, DoubleType} import org.apache.spark.sql.functions.{col, when} val schema = StructType(Seq(StructField("value", DoubleType, false))) val df = spark.read .schema(schema) .option("nullValue", "\\N") // 注意转义,Scala中\需要用\\表示 .csv("/path to csv file") // 将null替换为0.0,确保符合非空要求 .withColumn("value", when(col("value").isNull, 0.0).otherwise(col("value")))
方法2:先按字符串读取,处理后转Double
如果担心严格Schema校验导致读取失败,可以先把所有列按字符串读取,替换\N为"0.0"后再转换为Double类型:
import org.apache.spark.sql.functions.{col, when} // 先按无Schema方式读取,默认列名为_c0 val tempDf = spark.read .option("header", "false") // 无表头时设置,有表头则改为true .csv("/path to csv file") // 替换\N为0.0并转换类型 .withColumn("value", when(col("_c0") === "\\N", "0.0").otherwise(col("_c0")).cast(DoubleType)) .select("value") // 若需要严格匹配原Schema,可再次确认类型 val df = tempDf.withColumn("value", col("value").cast(DoubleType))
内容的提问来源于stack exchange,提问作者Zhe Hou
相关产品推荐
相关产品推荐

