如何用Spark计算文本文件的总单词数(含重复)
解决Spark统计包含重复单词的总单词数问题
要实现统计包含重复单词在内的总单词数,需将DO_SOME_MAGIC()替换为以下操作链:
def words(): f = sc.textFile("text.txt") return f.flatMap(lambda line: line.split()).count()
操作说明:
flatMap(lambda line: line.split()):将文本每行按空格拆分单词,flatMap会把所有行拆分出的单词平铺成一个包含全部单词的RDD(比如示例文本会生成["hello", "world", "bye", "world"]这样的RDD)。count():统计该RDD中元素的总数量,即所有单词的个数(包含重复),对应示例中的预期输出4。
内容的提问来源于stack exchange,提问作者coderodde
相关产品推荐
相关产品推荐

