PySpark如何编写SQL查询从sample_titanic表中选取前10条记录
实现方案
以下代码可直接完成你的两个需求:
# 定义查询sample_titanic前10条记录的SQL语句 sql_query = "SELECT * FROM sample_titanic LIMIT 10" # 调用SparkSession的sql方法执行查询,结果赋值给变量result_df result_df = spark_ex.sql(sql_query) # 执行后可以调用show方法打印结果验证 result_df.show()
如果需要把查询结果转换为Python原生的列表格式,可在后续调用result_df.collect(),返回结果和你之前使用DataFrame API得到的spark_df.limit(10).collect()完全一致。
内容的提问来源于stack exchange,提问作者Poles McKensey
相关产品推荐
相关产品推荐

