You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用pandas get_dummies处理含多值的行生成哑变量?

解决逗号分隔字符串生成哑变量的问题

问题原因

直接使用pd.get_dummies()时,函数会将每行的完整字符串视为一个独立类别,而非识别其中的单个水果,因此生成了错误的列。

解决方案

有两种简洁的实现方式:

方法一:使用str.get_dummies(推荐)

利用Pandas字符串方法str.get_dummies,指定分隔符即可直接生成目标哑变量:

import pandas as pd

# 构造示例DataFrame
df = pd.DataFrame({
    'Fruits': ['apple, banana, strawberry', 'apple', 'strawberry, apple']
})

# 生成哑变量
dummies = df['Fruits'].str.get_dummies(sep=', ')
print(dummies)

方法二:拆分展开后聚合

如果需要更灵活的处理(比如后续有其他操作),可以先拆分字符串为列表,展开后生成哑变量再按原索引求和:

import pandas as pd

df = pd.DataFrame({
    'Fruits': ['apple, banana, strawberry', 'apple', 'strawberry, apple']
})

# 拆分字符串为列表并展开每个元素
df_expanded = df['Fruits'].str.split(', ', expand=False).explode()

# 生成哑变量并按原索引聚合求和
dummies = pd.get_dummies(df_expanded).groupby(df_expanded.index).sum()
print(dummies)

输出结果

两种方法都会得到目标数据:

applebananastrawberry
111
100
101

内容的提问来源于stack exchange,提问作者A K

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.14 21:37:14