使用Polars处理超内存(Larger-than-memory)Parquet嵌套数组数据集的技术问询
使用Polars处理超内存(Larger-than-memory)Parquet嵌套数组数据集的技术问询
我现在碰到个棘手的问题:手头有个大小远超内存的Parquet数据集,里面包含了嵌套数组结构,用Polars的LazyFrame模拟出来的话大概是这样的(原始schema有部分截断,我尽量还原了核心结构):
import polars as pl df = pl.LazyFrame( { "target": [ [1.0, 2.0], [3.0, 4.0], ], "point_cloud": [ [ [7.0, 8.0], [9.0, 10.0], ], [ [9.0, 10.0], ], ], }, schema={ "target": pl.Array(pl.Float3... # 原始内容此处截断,推测为Float32/Float64类型 "point_cloud": pl.Array(pl.Array(pl.Float3... # 对应嵌套数组的浮点类型schema } )
我想请教下,怎么用Polars来高效处理这种超内存的嵌套数组Parquet文件?比如在读取、做数据转换或者分析的时候,怎么避免内存溢出,同时还能保证处理效率?
备注:内容来源于stack exchange,提问作者DJDuque
相关产品推荐
相关产品推荐

