Pandas按条件拆分单列转为多列的高效实现方案咨询
解决方案
无需引入额外工具包,直接使用Pandas内置的向量化操作即可实现,性能远高于手动for循环遍历,具体实现如下:
方法1:explode + 透视表(可读性更高)
import pandas as pd # 假设原始DataFrame为df # 1. 拆分逗号分隔的Value列,转为长格式 df_exploded = df.assign(Value=df['Value'].str.split(',')).explode('Value') # 2. 将Value转为数值类型 df_exploded['Value'] = df_exploded['Value'].astype(int) # 3. 透视转为宽表,保留对应数值 result = df_exploded.pivot_table( index=df_exploded.index, columns='Value', values='Value', aggfunc='first' ) # 4. 可选:补全1~9所有列(无值的位置留空) result = result.reindex(columns=range(1, 10))
注意:如果你的原始数据中
Index是单独存储的列而非DataFrame行索引,只需将上述pivot_table的index参数改为index='Index'即可。
方法2:str.get_dummies 快捷实现(写法更简洁)
# 拆分后生成0/1哑变量,再将1替换为对应列名的数值 result = df['Value'].str.get_dummies(sep=',').apply( lambda col: col * int(col.name), axis=0 ).reindex(columns=range(1, 10)) # 若要保留原始Index列,补充以下代码 result = df[['Index']].join(result)
两种方法均为全向量化运算,处理十万级以上数据时速度比手动for循环快数百倍。
内容的提问来源于stack exchange,提问作者yuan
相关产品推荐
相关产品推荐

