You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用PySpark将数组列转换为布尔值独立列?

PySpark数组列转布尔值独立列解决方案

实现思路

核心逻辑是先确定数组列中的所有唯一元素,再针对每个元素使用array_contains函数判断每行是否包含该元素,生成对应的布尔值列。

代码实现

假设你的DataFrame名为df,具体步骤如下:

  1. 提取数组中的所有唯一元素
    如果元素不固定,先通过explode展开数组再去重获取所有元素:
from pyspark.sql import functions as F

# 获取Answers列的所有唯一元素
unique_items = df.select(F.explode("Answers").alias("item")).distinct().rdd.flatMap(lambda x: x).collect()
  1. 生成布尔值列
    遍历每个唯一元素,用array_contains判断存在性并创建新列:
# 为每个元素添加布尔列
df_result = df.select(
    "Name", "Age",
    *[F.array_contains(F.col("Answers"), item).alias(item) for item in unique_items]
)

如果元素是固定已知的(比如示例中的apple, mango, orange, banana),可以直接写死元素列表,省去提取步骤:

fixed_items = ["apple", "mango", "orange", "banana"]
df_result = df.select(
    "Name", "Age",
    *[F.array_contains(F.col("Answers"), item).alias(item) for item in fixed_items]
)

输出结果

执行后得到的df_result结构与你期望的输出完全一致:

+------------+---+-----+-----+------+-------+
| Name       |Age|apple|mango|orange|banana |
+------------+---+-----+-----+------+-------+
| Maria      |23 |true |true |true  |true   |
| John       |55 |true |false|true  |true   |
| Brad       |44 |false|false|false |true   |
+------------+---+-----+-----+------+-------+

内容的提问来源于stack exchange,提问作者ar_mm18

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.14 03:35:27