You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何简便识别Parquet数据集的分区变量?

识别Parquet数据集分区变量的简便方法

在R的arrow包中,完全不需要手动解析文件路径来提取分区变量,直接读取数据集元数据就能高效获取:

  1. 先打开目标Parquet数据集:
library(arrow)
ds <- open_dataset("~/boop")
  1. 获取分区变量信息:
  • 查看包含变量名和类型的完整分区结构:
ds$partitioning
#> StructType
#> cyl: int32
  • 直接提取分区变量的名称:
names(ds$partitioning)
#> [1] "cyl"

如果是多分区场景(比如创建时用了partitioning = c("cyl", "gear")),用同样方法能一次性获取所有分区变量:

names(ds$partitioning)
#> [1] "cyl"  "gear"

这种方法完全依赖数据集内置元数据,无需手动处理路径字符串,多分区场景下也能快速得到结果。


内容的提问来源于stack exchange,提问作者Dan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.05 13:20:37