PySpark中如何移除stack()表达式内字段值的单引号?
解决PySpark stack()函数生成合法unpivot表达式的问题
直接针对你的需求,给你两种简洁的实现方式:
方式一:循环遍历处理(直观易懂)
假设你的原始嵌套列表是fields = [['field1','field1'], ['field2','field2'], ...],我们可以逐个处理每个子列表的元素:
# 初始化空列表存格式化后的参数 formatted_params = [] for field_name, col_name in fields: # 字段名加单引号作为字符串字面量 formatted_params.append(f"'{field_name}'") # 字段值直接用列名(不带单引号) formatted_params.append(col_name) # 生成unpivot表达式 # stack的第一个参数是组数,也就是嵌套列表的长度 unpivot_expr = f"stack({len(fields)}, {', '.join(formatted_params)})"
方式二:列表推导式(简洁一行流)
如果喜欢更紧凑的写法,用列表推导式一次性处理所有元素:
fields = [['field1','field1'], ['field2','field2'], ...] formatted_params = [item for pair in fields for item in (f"'{pair[0]}'", pair[1])] unpivot_expr = f"stack({len(fields)}, {', '.join(formatted_params)})"
这样生成的表达式就是合法格式,比如stack(2, 'field1', field1, 'field2', field2),直接放到你的select语句里即可:
unpivot_df = df.select("hashKey", expr(unpivot_expr))
为什么之前的方法不对?
你之前直接把一维列表转成字符串,会给所有元素都加上单引号,但我们需要区分字段名(作为字符串字面量,要加单引号)和字段值(作为DataFrame列名,不能加单引号),所以必须分开处理每组的两个元素,不能直接用列表转字符串的方式。
内容的提问来源于stack exchange,提问作者Ron
相关产品推荐
相关产品推荐

