如何将二维Numpy数组的组合值编码为一维数组?
高效实现Numpy二维数组行的唯一值映射
针对百万级行数的Numpy二维数组,要给每个唯一行分配唯一整数ID并生成对应一维数组,推荐以下两种高效实现方式:
方法一:利用view+np.unique(整数数组最优)
这种方法通过将二维数组的行转换为连续内存块的视图,把行比较转化为单个元素比较,底层由C实现,速度极快且内存占用低。
示例代码:
import numpy as np # 输入二维数组 arr = np.array([[2, 1], [1, 1], [2, 2], [2, 2], [1, 1], [1, 1], [2, 1], [1, 1], [1, 2], [1, 2]]) # 将每行转为连续内存的视图(针对整数类型数组) row_view = arr.view(np.dtype((np.void, arr.dtype.itemsize * arr.shape[1]))) # 获取唯一行的逆映射,得到目标一维数组 _, unique_indices = np.unique(row_view, return_inverse=True) print(unique_indices) # 输出:[0 1 2 2 1 1 0 1 3 3]
方法二:直接使用np.unique的axis参数(通用场景)
Numpy 1.13及以上版本支持axis参数,可以直接指定按行去重并返回映射索引,适合浮点数数组或不想处理视图的场景。
示例代码:
import numpy as np arr = np.array([[2, 1], [1, 1], [2, 2], [2, 2], [1, 1], [1, 1], [2, 1], [1, 1], [1, 2], [1, 2]]) _, unique_indices = np.unique(arr, axis=0, return_inverse=True) print(unique_indices) # 输出:[0 1 2 2 1 1 0 1 3 3]
性能说明
- 对于整数数组,方法一的速度明显优于方法二,因为视图操作避免了逐行元素比较的开销。
- 处理百万级数据时,两种方法都能在毫秒级完成,远快于Python循环或手动哈希映射的方式。
内容的提问来源于stack exchange,提问作者DSantiagoBC
相关产品推荐
相关产品推荐

