sparklyr count方法失效:无法找到适用于'tbl_spark'的继承方法
解决sparklyr中
count()对tbl_spark报错的问题 嗨,这个报错我之前也碰到过,大概率是dplyr的方法没和sparklyr的Spark表格对象正确绑定,或者是版本兼容的问题。给你几个实用的解决思路:
1. 先检查版本兼容性
sparklyr和dplyr的版本得搭配合适,不然很容易出这种方法找不到的问题。先看看你当前的版本:
packageVersion("sparklyr") packageVersion("dplyr")
比如sparklyr 1.8以上一般需要dplyr 1.0及以上的版本。如果版本不匹配,直接更新两个包就行:
install.packages(c("sparklyr", "dplyr"))
2. 显式指定用dplyr的count方法
有时候R环境里有其他包的count函数(比如plyr)会冲突,这时候直接指定用dplyr的版本就好。记得先把本地数据传到Spark集群里再操作:
# 把本地iris复制到Spark集群 iris_tbl <- copy_to(sc, iris, "iris") # 显式调用dplyr::count dplyr::count(iris_tbl, Species)
3. 重新加载包试试
偶尔包加载顺序不对也会导致方法绑定失败,试试卸载重装两个包:
detach("package:dplyr", unload = TRUE) detach("package:sparklyr", unload = TRUE) library(sparklyr) library(dplyr) # 重新连YARN sc <- spark_connect(master = "yarn") iris_tbl <- copy_to(sc, iris, "iris") count(iris_tbl, Species)
4. 排查是否有其他包抢了count方法
比如plyr包也有count函数,会和dplyr的方法冲突。你可以先查查当前count函数来自哪个包:
find("count")
如果看到plyr在列表里,赶紧把它卸载或者 detach 掉:
detach("package:plyr", unload = TRUE)
之后再试count操作应该就正常了。
最后验证一下正确的操作流程
要注意,你之前的head(iris)是操作本地数据,sparklyr的count得用Spark上的表格对象,正确流程应该是这样:
sc <- spark_connect(master = "yarn") # 把本地iris上传到Spark集群 iris_spark <- copy_to(sc, iris, "iris_table") # 现在对Spark上的表用count iris_spark %>% count(Species)
内容的提问来源于stack exchange,提问作者Giuthas
相关产品推荐
相关产品推荐

