Spark DataFrame删除指定ID列表行失败,求正确实现方法
解决Spark DataFrame删除指定ID行的问题
嗨,我来帮你搞定这个问题!你之前的两种写法都没找对Spark操作的逻辑,我给你拆解下问题原因,再给你正确的实现方式:
为什么你的方法无效?
第一种写法:
df.drop(col("id").isin(lisst:_*))
Spark里的drop()方法是用来删除列的,参数只能是列名(字符串)或者列对象,它根本不接受布尔条件来过滤行。所以这个写法从一开始就搞错了API的用途,自然不会生效。第二种写法:
df.filter(col("id").isin(lisst:_*).drop("id"))
这里的逻辑完全混乱了:col("id").isin(lisst:_*)返回的是一个布尔类型的Column(用来标记每行ID是否在列表里),但你给它调用.drop("id")是完全错误的——布尔Column没有这个方法,而且你本来要删除的是ID在列表里的行,应该是保留ID不在列表里的行,也就是要对布尔条件取反,而不是做这种无效操作。这就是为什么你的df1和原df行数完全一致,因为这个错误的写法相当于没有过滤任何行。
正确的实现方式
要删除ID在指定列表中的行,本质是过滤出ID不在列表里的行,你可以用以下两种方式:
方式一:用filter加取反条件
val lisst = List(4,9,200) val df1 = df.filter(!col("id").isin(lisst:_*))
或者用not()方法更清晰:
val df1 = df.filter(col("id").isin(lisst:_*).not)
方式二:用where(和filter功能完全一致,只是语法不同)
val df1 = df.where(!col("id").isin(lisst:_*))
这两种写法都会正确保留ID不在lisst列表中的行,也就是达到了你“删除ID在列表里的行”的需求。
内容的提问来源于stack exchange,提问作者Chaouki
相关产品推荐
相关产品推荐

