执行sqlContext.createDataFrame报错:'PipelinedRDD'无'_get_object_id'属性
解决PySpark中
createDataFrame报错'PipelinedRDD' object has no attribute '_get_object_id'的问题 我来帮你拆解这个报错的核心原因:
这个错误本质是你传给sqlContext.createDataFrame()的hvac是一个PipelinedRDD对象,但createDataFrame方法并不接受这种类型的输入。
具体原因拆解
createDataFrame期望的输入是可以直接被序列化解析的本地数据结构,比如Python列表、Pandas DataFrame、Row对象的集合这类。- 而PipelinedRDD是Spark执行
map、filter这类转换操作后生成的分布式数据集,它是延迟计算的,本身只是一个计算逻辑的封装,不是实际的数据集合,自然无法被createDataFrame直接处理。 - 你大概率是在生成
hvac的时候,只做了RDD的转换操作,没有触发collect()这类行动操作把数据拉取到Driver端,导致hvac还是一个未执行的RDD实例。
快速解决办法
有两种靠谱的处理方式:
- 直接使用RDD自带的
toDF()方法来转换(这是Spark推荐的RDD转DataFrame的方式):hvacTable = hvac.toDF() - 如果一定要用
createDataFrame,先把RDD的数据收集到本地(注意:仅适用于数据量较小的场景,否则会撑爆Driver内存):hvac_local = hvac.collect() hvacTable = sqlContext.createDataFrame(hvac_local)
内容的提问来源于stack exchange,提问作者Will
相关产品推荐
相关产品推荐

