如何将分区Parquet文件读取到Polars DataFrame中?
读取分区Parquet文件到Polars DataFrame的解决方法
Spark能自动识别分区目录结构,但Polars的read_parquet默认只接受单个文件路径,直接传入分区目录就会触发IsADirectoryError。解决方法如下:
用通配符匹配目录下所有Parquet文件:
匹配当前目录下的所有Parquet文件:df = pl.read_parquet("/my/path/*.parquet")递归匹配所有子目录里的Parquet文件:
df = pl.read_parquet("/my/path/**/*.parquet")大数据量场景推荐用懒加载方式,先扫描再收集:
df = pl.scan_parquet("/my/path/**/*.parquet").collect()若为Hive风格分区(路径含
key=value格式,如/my/path/year=2023/month=10/),需要开启hive_partitioning参数来自动加载分区列:df = pl.read_parquet("/my/path/**/*.parquet", hive_partitioning=True)懒加载版本:
df = pl.scan_parquet("/my/path/**/*.parquet", hive_partitioning=True).collect()
内容的提问来源于stack exchange,提问作者lmocsi
相关产品推荐
相关产品推荐

