You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何高效利用JaggedArray索引对另一JaggedArray排序过滤?

高效处理JaggedArray索引匹配的方案

当然有更高效的实现方式!你现在用的Python循环虽然直观,但面对大规模数据时效率会很低——Awkward Array的核心优势就是用向量化操作处理这种不规则数组,完全不需要手动遍历每个元素。

优化后的实现代码

import awkward as ak
import numpy as np

# 你的原始数据
indices = ak.fromiter([[0, -1], [3,1,-1], [-1,0,-1]])
values = ak.fromiter([[1.1, 1.2, 1.3], [2.1,2.2,2.3,2.4], [3.1]])

# 1. 将-1替换为对应values子数组的长度(超出索引范围会触发default填充)
adjusted_indices = ak.where(indices == -1, ak.num(values)[..., np.newaxis], indices)

# 2. 向量化提取元素,超出范围的位置用0填充
new_map = ak.take(values, adjusted_indices, axis=1, default=0)

print(new_map)

代码解释

  • ak.num(values):获取每个values子数组的长度,得到结果[3, 4, 1]。加上[..., np.newaxis]是为了让它的结构和indices匹配(从一维数组转为和indices同结构的JaggedArray)。
  • ak.where:批量替换indices中的-1为对应子数组的长度,这样后续用ak.take时,超出范围的索引会自动触发default参数的填充值。
  • ak.take:axis=1参数指定在每个子数组内部进行索引操作,完美匹配你的需求——每个indices子数组对应values子数组的索引列表;default=0则直接将无匹配的位置设为0。

优势对比

这种向量化实现完全由Awkward Array的C++内核处理,比Python循环快几个数量级,尤其是当你处理百万级甚至更大规模的不规则数组时,性能提升会非常明显。

内容的提问来源于stack exchange,提问作者Clemens

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.14 08:09:41