Spark报错:聚合函数内不可用窗口函数,如何修正代码?
解决PySpark AnalysisException:聚合函数内不能使用窗口函数的问题
错误原因
你写的代码存在语法逻辑错误——把窗口函数的.over()调用直接嵌套进了F.sum()的参数里,相当于让聚合函数sum包裹窗口函数,这违反了Spark的规则:不允许在聚合函数内部使用窗口函数。
修改后的代码
import sys from pyspark.sql import functions as F from pyspark.sql.window import Window Master_Table_All_2 = Master_Table_All.withColumn( "cumulative_paid_in_target_currency_period", F.sum("damage_amount_target_currency_in_period").over( Window.partitionBy("key") .orderBy("date_end") .rowsBetween(-sys.maxsize, 0) ) )
修改说明
- 核心调整:将原代码中
Master_Table_All.damage_amount_target_currency_in_period.over(...)的写法,改为F.sum("damage_amount_target_currency_in_period").over(...),让窗口函数作为聚合函数sum的执行上下文,而非参数。 - 逻辑保留:这段代码依然实现了按
key分组、按date_end排序,计算从分组第一条数据到当前行的damage_amount_target_currency_in_period累计和的需求。
内容的提问来源于stack exchange,提问作者mimi
相关产品推荐
相关产品推荐

