You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在PySpark中统计停用词过滤后词频以生成词云或词频统计结果

PySpark 词频统计实现方案

你可以直接使用explode函数拆分数组列后分组统计,具体实现如下:

  1. 首先导入依赖函数
from pyspark.sql.functions import explode, col
  1. 执行词频统计逻辑
# 拆分数组列+分组统计+按词频倒序排序
word_count_df = df.select(explode(col("terms_stemmed")).alias("terms_stemmed")) \
                  .groupBy("terms_stemmed") \
                  .count() \
                  .orderBy(col("count").desc())

执行后word_count_df就是你需要的格式,你可以直接调用word_count_df.show()验证结果。
如果需要过滤低频词,可在统计后增加过滤条件:

# 示例:仅保留出现次数大于等于5的词汇
word_count_df = word_count_df.filter(col("count") >=5)

内容的提问来源于stack exchange,提问作者gigioneggiavamo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 00:27:03