PySpark:如何实现DataFrame列值为另一列子串的关联查询
PySpark 基于名称匹配的DataFrame关联问题
我搜索过相关PySpark问题但未找到答案。现有两个DataFrame:
- df1�换 Sim等clAdministration/从顺筛选皮
-数据集 - df2:存储清洗后名称的数据集
希望通过.join()、.isin()或其他PySpark原生方法得到目标结果表(见附图)。
我尝试了以下代码:
cond = [df2[Clean_names].isin(df1[Names])] df1 = df1.join(df2, cond, "left")
执行时出现错误,提示.join()参数不符合要求(具体错误日志已丢失)。
需要注意的是,实际DataFrame数据量极大,禁止使用迭代操作(如for循环、Pandas的.loc()等),也不能转为Pandas处理。
注:刚注册Stack Overflow账号,若格式有误请见谅。
内容的提问来源于stack exchange,提问作者jota_ele_a
相关产品推荐
相关产品推荐

