在PySpark中按指定列统计数据集行数
PySpark按Column3分组统计行数解决方案
直接用PySpark的groupBy结合count()方法就能实现需求,以下是具体代码示例:
# 假设你的原始数据集是名为df的DataFrame # 按Column3分组统计行数,并重命名统计列(可选,根据结果需求调整) result_df = df.groupBy("Column3").count().withColumnRenamed("count", "row_count") # 查看结果 result_df.show()
代码说明
groupBy("Column3"):以Column3列的取值作为分组依据.count():自动统计每个分组内的行数.withColumnRenamed("count", "row_count"):将默认生成的统计列名count改为更清晰的row_count,如果不需要改名可以省略这一步
如果需要对统计结果按行数排序,可追加排序逻辑:
# 按统计行数降序排列结果 result_df = result_df.orderBy("row_count", ascending=False)
内容的提问来源于stack exchange,提问作者Nabs335
相关产品推荐
相关产品推荐

