You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将二维Numpy数组的组合值编码为一维数组?

高效实现Numpy二维数组行的唯一值映射

针对百万级行数的Numpy二维数组,要给每个唯一行分配唯一整数ID并生成对应一维数组,推荐以下两种高效实现方式:

方法一:利用view+np.unique(整数数组最优)

这种方法通过将二维数组的行转换为连续内存块的视图,把行比较转化为单个元素比较,底层由C实现,速度极快且内存占用低。

示例代码:

import numpy as np

# 输入二维数组
arr = np.array([[2, 1], [1, 1], [2, 2], [2, 2], [1, 1], [1, 1], [2, 1], [1, 1], [1, 2], [1, 2]])

# 将每行转为连续内存的视图(针对整数类型数组)
row_view = arr.view(np.dtype((np.void, arr.dtype.itemsize * arr.shape[1])))

# 获取唯一行的逆映射,得到目标一维数组
_, unique_indices = np.unique(row_view, return_inverse=True)

print(unique_indices)
# 输出:[0 1 2 2 1 1 0 1 3 3]

方法二:直接使用np.unique的axis参数(通用场景)

Numpy 1.13及以上版本支持axis参数,可以直接指定按行去重并返回映射索引,适合浮点数数组或不想处理视图的场景。

示例代码:

import numpy as np

arr = np.array([[2, 1], [1, 1], [2, 2], [2, 2], [1, 1], [1, 1], [2, 1], [1, 1], [1, 2], [1, 2]])

_, unique_indices = np.unique(arr, axis=0, return_inverse=True)

print(unique_indices)
# 输出:[0 1 2 2 1 1 0 1 3 3]

性能说明

  • 对于整数数组,方法一的速度明显优于方法二,因为视图操作避免了逐行元素比较的开销。
  • 处理百万级数据时,两种方法都能在毫秒级完成,远快于Python循环或手动哈希映射的方式。

内容的提问来源于stack exchange,提问作者DSantiagoBC

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.12 02:22:47