You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在PySpark中按指定列统计数据集行数

PySpark按Column3分组统计行数解决方案

直接用PySpark的groupBy结合count()方法就能实现需求,以下是具体代码示例:

# 假设你的原始数据集是名为df的DataFrame
# 按Column3分组统计行数,并重命名统计列(可选,根据结果需求调整)
result_df = df.groupBy("Column3").count().withColumnRenamed("count", "row_count")

# 查看结果
result_df.show()

代码说明

  • groupBy("Column3"):以Column3列的取值作为分组依据
  • .count():自动统计每个分组内的行数
  • .withColumnRenamed("count", "row_count"):将默认生成的统计列名count改为更清晰的row_count,如果不需要改名可以省略这一步

如果需要对统计结果按行数排序,可追加排序逻辑:

# 按统计行数降序排列结果
result_df = result_df.orderBy("row_count", ascending=False)

内容的提问来源于stack exchange,提问作者Nabs335

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.25 01:03:26