You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在PySpark中读取Hive分区表指定分区以替代直接读取Parquet

解决方案

针对Hive分区表,Spark优化器支持分区裁剪特性,只要对分区字段加过滤条件即可实现仅读取指定分区,完全避免全表扫描,和你之前用路径通配符读取的效果一致,共有两种常用实现方式:

方法1:DataFrame直接加过滤条件(最简便)

# 写法1:用日期范围匹配,逻辑更严谨
df = spark.read.table("schema.my_dataset").filter("dt >= '2021-08-01' AND dt < '2021-09-01'")

# 写法2:和你之前的通配符逻辑完全对齐
df = spark.read.table("schema.my_dataset").filter("dt like '2021-08%'")

只要dt是表的正式分区字段,以上两种写法都会自动触发分区裁剪,仅扫描8月对应的分区,不会读取其他日期的数据。

方法2:通过Spark SQL语句查询

如果习惯写SQL可以用这种写法,效果完全相同:

df = spark.sql("""
SELECT * FROM schema.my_dataset
WHERE dt >= '2021-08-01' AND dt < '2021-09-01'
""")

验证分区裁剪生效的方法

如果需要确认是否真的没有扫描全表,可以打印执行计划校验:

df.explain()

在输出的执行计划中找到PartitionFilters项,能看到你设置的dt过滤规则即说明分区裁剪生效。

内容的提问来源于stack exchange,提问作者Grigory Sharkov

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 12:18:02