PySpark中如何将变量名作为列名传入过滤条件?
用变量作为列名在PySpark过滤Parquet文件
你当前代码存在两个问题:一是笔误df-spark应该改为df = spark;二是直接把变量名date_1当列名传入col(),正确的做法是用变量传递列名,具体两种实现方式:
方法一:通过
col()函数传入变量# 先定义存储列名的变量 date_1 = "实际列名" df = spark.read.load("s://location/").filter(col(date_1) >= upd_dttm)方法二:使用字符串格式化拼接过滤条件
date_1 = "实际列名" # 若upd_dttm是字符串类型,需要给值加单引号 df = spark.read.load("s://location/").filter(f"{date_1} >= '{upd_dttm}'")
内容的提问来源于stack exchange,提问作者user2104898
相关产品推荐
相关产品推荐

