使用Boto3调用Glue API的get_partitions时,expression字段应传入什么?
解决Glue分区精准查询:不用全量拉取再过滤
直接用get_partitions的Expression参数就能精准筛选目标分区,无需先拉取所有分区再本地过滤,大幅减少API调用量。
具体操作步骤
确认分区列的顺序与名称
先对应好你的分区值[1, '202210051', 1, 123]对应的表分区列(比如假设列名依次是p_type、p_datetime、p_status、p_id),顺序必须完全匹配。构造过滤表达式调用API
把每个分区列的匹配条件用AND连接,数字类型直接写值,字符串类型用单引号包裹,示例代码如下:
import boto3 glue_client = boto3.client('glue') response = glue_client.get_partitions( DatabaseName='你的数据库名称', TableName='你的表名称', Expression="p_type = 1 AND p_datetime = '202210051' AND p_status = 1 AND p_id = 123" ) # 获取匹配的目标分区 target_partitions = response['Partitions']
get_partitions API核心参数中文说明(翻译自官方文档)
get_partitions用于获取指定表的分区信息,核心参数说明:
DatabaseName:必填,目标数据库名称TableName:必填,目标表名称Expression:可选,分区过滤表达式,支持等于、大于/小于等比较操作,语法遵循Glue分区规则MaxResults:可选,单次调用返回的最大分区数,默认值为1000NextToken:可选,分页调用时的令牌,用于获取下一页结果
内容的提问来源于stack exchange,提问作者krak
相关产品推荐
相关产品推荐

