如何高效展开DataFrame单元格中的NumPy数组为多行?
解决Pandas DataFrame数组列高效展开为多行的问题
核心思路
先将所有数组列的元素扁平化(统一转为一维列表),再批量执行explode操作,避免循环处理,保证效率。
示例代码
1. 构造模拟数据
import pandas as pd import numpy as np # 模拟你的数据:包含单个值列、横向数组列、纵向数组列 df = pd.DataFrame({ 'id': [1, 2], 'single_col': ['x', 'y'], 'horizontal_array': [np.array([10,20,30]), np.array([40,50])], 'vertical_array': [np.array([[100],[200],[300]]), np.array([[400],[500]])] })
2. 定义扁平化函数
处理横向/纵向一维数组,统一转为一维列表:
def flatten_arr(arr): return arr.flatten().tolist()
3. 批量处理数组列并展开
# 自动识别所有存储数组的列 array_cols = [col for col in df.columns if isinstance(df[col].iloc[0], np.ndarray)] # 对数组列应用扁平化转换 df[array_cols] = df[array_cols].applymap(flatten_arr) # 批量展开所有数组列,生成新的DataFrame df_exploded = df.explode(array_cols, ignore_index=True)
效果验证
处理后df_exploded的输出:
id single_col horizontal_array vertical_array 0 1 x 10 100 1 1 x 20 200 2 1 x 30 300 3 2 y 40 400 4 2 y 50 500
问题原因说明
你之前尝试后数组仍保留格式,是因为纵向数组(shape(n,1))属于二维数组,Pandas的explode会把整个二维数组当作单个元素处理。通过flatten()将其转为一维数组后,explode才能正确拆分每个元素。
兼容混合类型场景
如果数组列中混合了单个值和数组,修改扁平化函数即可兼容:
def flatten_arr(arr): if isinstance(arr, np.ndarray): return arr.flatten().tolist() return [arr] # 把单个值转为单元素列表,保证explode逻辑一致
内容的提问来源于stack exchange,提问作者Thomas Hemming Larsen
相关产品推荐
相关产品推荐

