You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Spark计算文本文件的总单词数(含重复)

解决Spark统计包含重复单词的总单词数问题

要实现统计包含重复单词在内的总单词数,需将DO_SOME_MAGIC()替换为以下操作链:

def words():
    f = sc.textFile("text.txt")
    return f.flatMap(lambda line: line.split()).count()

操作说明:

  • flatMap(lambda line: line.split()):将文本每行按空格拆分单词,flatMap会把所有行拆分出的单词平铺成一个包含全部单词的RDD(比如示例文本会生成["hello", "world", "bye", "world"]这样的RDD)。
  • count():统计该RDD中元素的总数量,即所有单词的个数(包含重复),对应示例中的预期输出4。

内容的提问来源于stack exchange,提问作者coderodde

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.18 13:12:31