PySpark手动创建DataFrame时数据未插入问题求助
PySpark DataFrame数据未显示的问题解决
你的代码已经成功将数据插入DataFrame,只是print(sparkDF)默认只会输出DataFrame的结构(Schema信息),不会展示具体数据内容。
要查看DataFrame里的实际数据,可以用以下几种方法:
使用
show()方法(最常用):sparkDF.show()输出示例:
+--------+-----------+
|language|users_count|
+--------+-----------+
| Java| 20000|
| Python| 100000|
| Scala| 3000|
+--------+-----------+显示全部数据(适合小数据集):
# 不截断内容,显示所有行 sparkDF.show(truncate=False, n=sparkDF.count())转换为Pandas DataFrame查看:
sparkDF.toPandas()该方法会返回Pandas格式的表格,完整展示所有数据(注意:大数据集会占用较多内存,慎用)。
另外,你代码中创建的rdd变量并未实际使用,因为spark.createDataFrame可以直接接收列表类型的数据,这部分不影响DataFrame的创建结果。
内容的提问来源于stack exchange,提问作者amber_coder_backup
相关产品推荐
相关产品推荐

