You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Vaex如何通过mask列过滤数据后对指定列执行分bin统计

Vaex按mask条件过滤后分bin统计实现方法

你可以直接通过count方法的selection参数指定过滤条件,不需要提前拆分数据集,天然适配Vaex的懒加载机制,对千万级规模的数据集无额外内存压力:

# 方法1:直接在count调用中指定过滤条件,性能最优
result = df.count(
    binby=axes,
    limits=limits,
    shape=(binnum,)*len(axes),
    selection=df.mask == 1,
    delay=True
)

如果需要多次基于mask=1的条件做不同统计,也可以先过滤得到子集再执行分bin操作:

# 方法2:先过滤得到mask为1的子集,适合多轮统计场景
df_masked = df[df.mask == 1]
result = df_masked.count(
    binby=axes,
    limits=limits,
    shape=(binnum,)*len(axes),
    delay=True
)

两种方式的统计结果完全一致,方法1适合单次统计的场景,省去了生成中间视图的步骤,性能表现更好。

内容的提问来源于stack exchange,提问作者afriedman111

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 21:18:05