Scala如何移除字符串首尾双引号?DataFrame场景实现咨询
嘿,这个需求很常见!在Scala里完全可以实现类似Python ltrim/rtrim的效果,而且针对Spark DataFrame的场景,有几种高效的处理方式,我给你详细说说:
方法1:用Spark SQL内置trim函数(推荐,无需自定义UDF)
Spark SQL自带的trim函数非常适合这个场景,它支持指定要移除的字符,通过BOTH关键字可以同时清除首尾的目标字符,完美匹配你的需求——只删掉字符串首尾的双引号,中间的内容(包括单引号、连字符、下划线这些)完全保留。
代码示例:
import org.apache.spark.sql.SparkSession import org.apache.spark.sql.functions.expr object RemoveQuotesExample { def main(args: Array[String]): Unit = { val spark = SparkSession.builder() .appName("RemoveQuotes") .master("local[*]") .getOrCreate() import spark.implicits._ // 模拟你的输入DataFrame val originalDF = Seq( "\"john belushi\"", "\"john mnunjnj\"", "\"nmnj tyhng\"", "\"John b-e_lushi\"", "\"john belushi's book\"" ).toDF("data") // 核心逻辑:用trim移除首尾双引号 val cleanedDF = originalDF.withColumn( "data", expr("trim(BOTH '\"' FROM data)") ) // 查看结果 cleanedDF.show(false) } }
这个方法不用写自定义UDF,Spark会自动做性能优化,处理大数据量时更高效。
方法2:自定义Scala字符串处理逻辑(灵活适配复杂场景)
如果你需要更灵活的控制(比如只移除开头或只移除结尾的引号),可以用Scala字符串的stripPrefix和stripSuffix方法——这两个就是Python ltrim('"')和rtrim('"')的Scala等效方法。配合自定义UDF就能用到DataFrame上:
import org.apache.spark.sql.functions.udf import org.apache.spark.sql.functions.col // 定义UDF:移除首尾双引号 val removeQuotesUdf = udf((str: String) => { str.stripPrefix("\"").stripSuffix("\"") }) // 应用到DataFrame val cleanedDF = originalDF.withColumn( "data", removeQuotesUdf(col("data")) )
要是你偏好正则表达式,也可以这么写UDF:
val removeQuotesUdf = udf((str: String) => { // 匹配开头或结尾的双引号,替换为空 str.replaceAll("^\"|\"$", "") })
纯Scala字符串处理(非DataFrame场景)
如果是单独处理Scala字符串,直接调用上面提到的方法就行:
val quotedStr = "\"john belushi's book\"" val cleanedStr = quotedStr.stripPrefix("\"").stripSuffix("\"") // 或者用正则:quotedStr.replaceAll("^\"|\"$", "")
内容的提问来源于stack exchange,提问作者user3407267
相关产品推荐
相关产品推荐

