PySpark中无需定义窗口规范使用Sum()窗口函数的问题
解决Spark DataFrame添加全局总计列的报错问题
你遇到的问题是Spark DataFrame API和SQL窗口函数的语法差异导致的:SQL里SUM(price) OVER ()默认表示全局窗口,但Spark的DataFrame API中over()方法必须显式传入一个Window对象,不能留空。下面是两种可行的解决方法:
方法1:显式定义全局窗口
先定义一个覆盖全表的窗口,再传入over()方法中:
from pyspark.sql import Window import pyspark.sql.functions as F # 定义全局窗口:包含从第一行到最后一行的所有数据 global_window = Window.rowsBetween(Window.unboundedPreceding, Window.unboundedFollowing) new_df = new_df.withColumn("grand_total", F.sum(F.col("price")).over(global_window))
如果你的Spark版本支持,也可以用更简洁的Window.allRows()替代上述窗口定义,效果完全一致:
global_window = Window.allRows() new_df = new_df.withColumn("grand_total", F.sum(F.col("price")).over(global_window))
方法2:先计算总合计再交叉连接
这种方法不需要用窗口函数,先单独算出price的总和,再通过交叉连接把这个值加到每一行:
import pyspark.sql.functions as F # 计算全局总合计 total_sum_df = new_df.select(F.sum("price").alias("grand_total")) # 交叉连接,给原表每行添加总计列 new_df = new_df.crossJoin(total_sum_df)
差异说明
SQL中的OVER()是语法糖,默认会生成覆盖全表的窗口;但Spark DataFrame API设计上要求必须显式声明窗口范围,所以不能直接写over()空参数调用。
内容的提问来源于stack exchange,提问作者Hassaan Anwar
相关产品推荐
相关产品推荐

