如何用pandas get_dummies处理含多值的行生成哑变量?
解决逗号分隔字符串生成哑变量的问题
问题原因
直接使用pd.get_dummies()时,函数会将每行的完整字符串视为一个独立类别,而非识别其中的单个水果,因此生成了错误的列。
解决方案
有两种简洁的实现方式:
方法一:使用str.get_dummies(推荐)
利用Pandas字符串方法str.get_dummies,指定分隔符即可直接生成目标哑变量:
import pandas as pd # 构造示例DataFrame df = pd.DataFrame({ 'Fruits': ['apple, banana, strawberry', 'apple', 'strawberry, apple'] }) # 生成哑变量 dummies = df['Fruits'].str.get_dummies(sep=', ') print(dummies)
方法二:拆分展开后聚合
如果需要更灵活的处理(比如后续有其他操作),可以先拆分字符串为列表,展开后生成哑变量再按原索引求和:
import pandas as pd df = pd.DataFrame({ 'Fruits': ['apple, banana, strawberry', 'apple', 'strawberry, apple'] }) # 拆分字符串为列表并展开每个元素 df_expanded = df['Fruits'].str.split(', ', expand=False).explode() # 生成哑变量并按原索引聚合求和 dummies = pd.get_dummies(df_expanded).groupby(df_expanded.index).sum() print(dummies)
输出结果
两种方法都会得到目标数据:
| apple | banana | strawberry |
|---|---|---|
| 1 | 1 | 1 |
| 1 | 0 | 0 |
| 1 | 0 | 1 |
内容的提问来源于stack exchange,提问作者A K
相关产品推荐
相关产品推荐

