You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将分区Parquet文件读取到Polars DataFrame中?

读取分区Parquet文件到Polars DataFrame的解决方法

Spark能自动识别分区目录结构,但Polars的read_parquet默认只接受单个文件路径,直接传入分区目录就会触发IsADirectoryError。解决方法如下:

  • 用通配符匹配目录下所有Parquet文件:
    匹配当前目录下的所有Parquet文件:

    df = pl.read_parquet("/my/path/*.parquet")
    

    递归匹配所有子目录里的Parquet文件:

    df = pl.read_parquet("/my/path/**/*.parquet")
    
  • 大数据量场景推荐用懒加载方式,先扫描再收集:

    df = pl.scan_parquet("/my/path/**/*.parquet").collect()
    
  • 若为Hive风格分区(路径含key=value格式,如/my/path/year=2023/month=10/),需要开启hive_partitioning参数来自动加载分区列:

    df = pl.read_parquet("/my/path/**/*.parquet", hive_partitioning=True)
    

    懒加载版本:

    df = pl.scan_parquet("/my/path/**/*.parquet", hive_partitioning=True).collect()
    

内容的提问来源于stack exchange,提问作者lmocsi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 02:04:54