如何简便识别Parquet数据集的分区变量?
识别Parquet数据集分区变量的简便方法
在R的arrow包中,完全不需要手动解析文件路径来提取分区变量,直接读取数据集元数据就能高效获取:
- 先打开目标Parquet数据集:
library(arrow) ds <- open_dataset("~/boop")
- 获取分区变量信息:
- 查看包含变量名和类型的完整分区结构:
ds$partitioning #> StructType #> cyl: int32
- 直接提取分区变量的名称:
names(ds$partitioning) #> [1] "cyl"
如果是多分区场景(比如创建时用了partitioning = c("cyl", "gear")),用同样方法能一次性获取所有分区变量:
names(ds$partitioning) #> [1] "cyl" "gear"
这种方法完全依赖数据集内置元数据,无需手动处理路径字符串,多分区场景下也能快速得到结果。
内容的提问来源于stack exchange,提问作者Dan
相关产品推荐
相关产品推荐

