You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Polars处理超内存(Larger-than-memory)Parquet嵌套数组数据集的技术问询

使用Polars处理超内存(Larger-than-memory)Parquet嵌套数组数据集的技术问询

我现在碰到个棘手的问题:手头有个大小远超内存的Parquet数据集,里面包含了嵌套数组结构,用Polars的LazyFrame模拟出来的话大概是这样的(原始schema有部分截断,我尽量还原了核心结构):

import polars as pl

df = pl.LazyFrame(
    {
        "target": [
            [1.0, 2.0],
            [3.0, 4.0],
        ],
        "point_cloud": [
            [
                [7.0, 8.0],
                [9.0, 10.0],
            ],
            [
                [9.0, 10.0],
            ],
        ],
    },
    schema={
        "target": pl.Array(pl.Float3...  # 原始内容此处截断,推测为Float32/Float64类型
        "point_cloud": pl.Array(pl.Array(pl.Float3...  # 对应嵌套数组的浮点类型schema
    }
)

我想请教下,怎么用Polars来高效处理这种超内存的嵌套数组Parquet文件?比如在读取、做数据转换或者分析的时候,怎么避免内存溢出,同时还能保证处理效率?

备注:内容来源于stack exchange,提问作者DJDuque

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.13 15:58:13