如何在Elasticsearch中将基数限制至指定阈值
解决Elasticsearch基数聚合的性能优化:限制最大唯一值统计数
如果你需要统计过滤后name字段的唯一值数量,但又不想因为数据量过大导致精确基数计算耗时过长,只需要将统计上限设为10000(达到该值后停止计算),可以通过修改cardinality聚合的参数来实现。
当前查询(无限制的精确基数统计)
当前你的查询会计算所有匹配文档中name.keyword的精确唯一值数量,当数据量很大时,这个过程会消耗更多时间:
GET /my_index/_search?size=0 { "query": { "bool": { "must": { "simple_query_string": { "query": "abc*", "fields": ["name"], "analyzer": "whitespace" } } } }, "aggs": { "unique_values": { "cardinality": { "field": "name.keyword" } } } }
对应的响应会返回精确的唯一值数量(比如示例中的98504),但这在数据量极大时会影响查询性能。
修改后的查询(限制最大统计值)
只需要在cardinality聚合中添加limit参数,设置为你想要的上限10000,当聚合过程中统计到的唯一值数量达到这个数值时,就会停止继续计算,直接返回该上限值:
GET /my_index/_search?size=0 { "query": { "bool": { "must": { "simple_query_string": { "query": "abc*", "fields": ["name"], "analyzer": "whitespace" } } } }, "aggs": { "unique_values": { "cardinality": { "field": "name.keyword", "limit": 10000 } } } }
期望的响应结果
此时响应中的聚合结果会返回10000,代表实际唯一值数量至少为10000,同时查询耗时会显著降低,因为不需要遍历所有匹配的文档:
{ "took" : 2, "timed_out" : false, "_shards" : { "total" : 12, "successful" : 12, "skipped" : 0, "failed" : 0 }, "hits" : { "total" : { "value" : 10000, "relation" : "eq" }, "max_score" : null, "hits" : [ ] }, "aggregations" : { "unique_values" : { "value" : 10000 } } }
内容的提问来源于stack exchange,提问作者Kfir Cohen
相关产品推荐
相关产品推荐

