如何使用Python elasticsearch-dsl查询account_number字段的全部唯一值
问题原因
你现在拿到全列完整行数据的核心原因是没有关闭原始文档返回,ES默认会返回匹配到的前10条原始文档,和你的聚合配置没有关系,你的terms聚合写在bucket里的逻辑是正确的,不需要额外配置metric也能拿到唯一值,示例里的metric只是用来给聚合结果排序用的,没有排序需求可以直接省略。
修改后的实现代码
search = Search(using=client, index=index_name).query( { "range": { "date": { "gte": "2021-08-01T08:00:00.000Z", "lte": "2021-08-31T23:59:59.599Z" } } }) # 新增:设置返回原始文档数量为0,仅返回聚合结果 search = search.extra(size=0) search.aggs.bucket("unique_account", "terms", field="account_number", size=1000) es_data = search.execute() # 提取所有唯一的account_number值 unique_accounts = [item.key for item in es_data.aggregations.unique_account.buckets]
注意事项
- 如果你的
account_number字段是text类型,需要改用对应的keyword子字段聚合,比如field="account_number.keyword",否则terms聚合会报错 - size参数要设置为大于等于你预期的唯一值总数,否则会出现数据遗漏,唯一值数量超过1万的话建议改用composite聚合做分页拉取
- 每个聚合bucket的
doc_count字段就是对应account_number出现的次数,不需要额外配置sum metric也能拿到计数
内容的提问来源于stack exchange,提问作者chowpay
相关产品推荐
相关产品推荐

