如何高效利用JaggedArray索引对另一JaggedArray排序过滤?
高效处理JaggedArray索引匹配的方案
当然有更高效的实现方式!你现在用的Python循环虽然直观,但面对大规模数据时效率会很低——Awkward Array的核心优势就是用向量化操作处理这种不规则数组,完全不需要手动遍历每个元素。
优化后的实现代码
import awkward as ak import numpy as np # 你的原始数据 indices = ak.fromiter([[0, -1], [3,1,-1], [-1,0,-1]]) values = ak.fromiter([[1.1, 1.2, 1.3], [2.1,2.2,2.3,2.4], [3.1]]) # 1. 将-1替换为对应values子数组的长度(超出索引范围会触发default填充) adjusted_indices = ak.where(indices == -1, ak.num(values)[..., np.newaxis], indices) # 2. 向量化提取元素,超出范围的位置用0填充 new_map = ak.take(values, adjusted_indices, axis=1, default=0) print(new_map)
代码解释
ak.num(values):获取每个values子数组的长度,得到结果[3, 4, 1]。加上[..., np.newaxis]是为了让它的结构和indices匹配(从一维数组转为和indices同结构的JaggedArray)。ak.where:批量替换indices中的-1为对应子数组的长度,这样后续用ak.take时,超出范围的索引会自动触发default参数的填充值。ak.take:axis=1参数指定在每个子数组内部进行索引操作,完美匹配你的需求——每个indices子数组对应values子数组的索引列表;default=0则直接将无匹配的位置设为0。
优势对比
这种向量化实现完全由Awkward Array的C++内核处理,比Python循环快几个数量级,尤其是当你处理百万级甚至更大规模的不规则数组时,性能提升会非常明显。
内容的提问来源于stack exchange,提问作者Clemens
相关产品推荐
相关产品推荐

