You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Elasticsearch中将基数限制至指定阈值

解决Elasticsearch基数聚合的性能优化:限制最大唯一值统计数

如果你需要统计过滤后name字段的唯一值数量,但又不想因为数据量过大导致精确基数计算耗时过长,只需要将统计上限设为10000(达到该值后停止计算),可以通过修改cardinality聚合的参数来实现。

当前查询(无限制的精确基数统计)

当前你的查询会计算所有匹配文档中name.keyword的精确唯一值数量,当数据量很大时,这个过程会消耗更多时间:

GET /my_index/_search?size=0
{ 
  "query": { 
    "bool": { 
      "must": { 
        "simple_query_string": { 
          "query": "abc*", 
          "fields": ["name"], 
          "analyzer": "whitespace" 
        } 
      } 
    } 
  }, 
  "aggs": { 
    "unique_values": { 
      "cardinality": { 
        "field": "name.keyword" 
      } 
    } 
  } 
}

对应的响应会返回精确的唯一值数量(比如示例中的98504),但这在数据量极大时会影响查询性能。

修改后的查询(限制最大统计值)

只需要在cardinality聚合中添加limit参数,设置为你想要的上限10000,当聚合过程中统计到的唯一值数量达到这个数值时,就会停止继续计算,直接返回该上限值:

GET /my_index/_search?size=0
{ 
  "query": { 
    "bool": { 
      "must": { 
        "simple_query_string": { 
          "query": "abc*", 
          "fields": ["name"], 
          "analyzer": "whitespace" 
        } 
      } 
    } 
  }, 
  "aggs": { 
    "unique_values": { 
      "cardinality": { 
        "field": "name.keyword",
        "limit": 10000 
      } 
    } 
  } 
}

期望的响应结果

此时响应中的聚合结果会返回10000,代表实际唯一值数量至少为10000,同时查询耗时会显著降低,因为不需要遍历所有匹配的文档:

{ 
  "took" : 2, 
  "timed_out" : false, 
  "_shards" : { 
    "total" : 12, 
    "successful" : 12, 
    "skipped" : 0, 
    "failed" : 0 
  }, 
  "hits" : { 
    "total" : { 
      "value" : 10000, 
      "relation" : "eq" 
    }, 
    "max_score" : null, 
    "hits" : [ ] 
  }, 
  "aggregations" : { 
    "unique_values" : { 
      "value" : 10000 
    } 
  } 
}

内容的提问来源于stack exchange,提问作者Kfir Cohen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.28 22:48:11