You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scala中如何按key分组统计distinct suppKey的数量?

解决Scala中按Key分组统计不同SuppKey数量的问题

我来帮你搞定这个问题!你的代码没法运行主要是没抓住分组统计去重的核心逻辑,还有几个小细节没处理对,咱们一步步来修正:

原代码的问题分析

你的代码val count= file.map(line=> (line.split('|')(0),line.split('|')(1)).distinct().count())有两个关键问题:

  1. 缺少分组操作:直接对(key, suppKey)元组调用distinct()是对整个RDD的元组去重,再count()得到的是全局唯一元组的总数,完全没实现按key分组统计的需求。
  2. 字符串拆分错误:split('|')里的|是正则表达式的特殊字符(表示“或”逻辑),用它拆分字符串会把每个字符都拆分开,导致你取到的parts(0)和parts(1)根本不是你想要的字段,必须转义成split("\\|")才能正确按|分隔字段。

正确实现方案

我们可以用两种方式实现需求,第二种更高效(先去重再分组,减少分组数据量):

方法1:分组后对每组去重统计

// 读取文件生成RDD
val fileRdd = sc.textFile("你的文件路径")

// 拆分每行,提取(key, suppKey)元组(注意转义|)
val keySuppPairs = fileRdd.map(line => {
  val fields = line.split("\\|")
  (fields(0), fields(1))
})

// 按key分组,对每个组内的suppKey去重后统计数量
val result = keySuppPairs.groupByKey()
  .mapValues(suppKeys => suppKeys.distinct.size)

// 输出期望格式的结果
result.foreach { case (key, count) => println(s"$key|$count") }

方法2:先去重元组再按key计数(推荐)

这种方式先把重复的(key, suppKey)对去掉,再统计每个key出现的次数,性能更好:

val fileRdd = sc.textFile("你的文件路径")

val keySuppPairs = fileRdd.map(line => {
  val fields = line.split("\\|")
  (fields(0), fields(1))
})

// 先去重所有(key, suppKey)对,再提取key并统计每个key的出现次数
val result = keySuppPairs.distinct()
  .map(_._1)
  .countByValue()

// 输出结果
result.foreach { case (key, count) => println(s"$key|$count") }

验证结果

用你提供的输入示例测试,两种方法都会输出:

1|3
2|2

完全符合你的期望!

内容的提问来源于stack exchange,提问作者Elias Konstantinou

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 07:45:57