Polars读取DynamoDB导出的NDJSON文件时内存占用过高问题求助
Polars读取DynamoDB导出的NDJSON文件时内存占用过高问题求助
各位Polars的大神们,求助!我最近在尝试用Polars flatten 从DynamoDB导出的NDJSON文件,结果遇到了内存占用爆炸的问题:
原NDJSON文件大小是1GB,用gz压缩后只有100MB,可一旦用Polars把它读入内存,居然要吃掉16GB的内存,这完全超出了我的预期!
另外还有个DynamoDB导出数据的固有问题:同一列可能存在多种数据类型。比如某列一年前存的是字符串类型,现在改成了布尔值,这种混合类型的情况也给数据处理添了不少麻烦。
为了排查问题,我专门做了个简化实验:只读取一个约150MB的单层级嵌套NDJSON文件(所有行的schema都是完全一致的),结果内存占用居然也达到了~390MB,这明显不太正常。
想问问大家,有没有什么办法能降低Polars读取这类文件时的内存占用?同时针对DynamoDB导出的混合类型列,有没有比较实用的处理方案?
内容来源于stack exchange
相关产品推荐
相关产品推荐

