Elasticsearch技术问询:如何按地理距离与评分排序聚合结果?
实现Elasticsearch聚合结果按地理距离+评分排序的方案
嘿,我来帮你搞定这个需求!结合你的索引结构,我们可以通过聚合+指标计算+多维度排序的方式实现按地理距离和评分对聚合结果排序的功能。下面分两种常见场景给你具体的实现方案:
场景1:按聚合桶的「平均/最小地理距离」+「平均评分」排序
这种场景适合你希望每个产品组(id_product)的排序依据是组内所有文档的距离统计值(比如最近距离、平均距离)加上组内文档的平均匹配评分。
示例DSL
假设我们要搜索包含coke的活跃产品,然后按id_product分组,排序规则是:先按到目标点(比如1.35, 103.8)的最近距离升序,再按组内平均评分降序:
GET places/test/_search { "size": 0, // 不需要返回原始文档,只看聚合结果 "query": { "bool": { "must": [ { "match": { "suggest": "coke" } }, // 文本匹配,生成基础评分 { "term": { "active": true } } // 过滤活跃产品 ] } }, "aggs": { "group_by_product": { "terms": { "field": "id_product", "order": [ { "min_distance": "asc" }, // 第一排序:最近距离升序 { "avg_score": "desc" } // 第二排序:平均评分降序 ] }, "aggs": { // 计算每个产品组内文档到目标点的最近距离(单位:km) "min_distance": { "geo_distance": { "field": "location", "origin": { "lat": 1.35, "lon": 103.8 }, "unit": "km", "distance_type": "plane" // 短距离用plane更快,长距离建议用arc } }, // 计算每个产品组内文档的平均匹配评分 "avg_score": { "avg": { "field": "_score" } } } } } }
关键部分解释
size: 0:关闭原始文档返回,专注于聚合结果,提升性能。geo_distance聚合:用来统计每个组内文档到目标点的距离(这里用min取最近距离,你也可以换成avg取平均距离)。order数组:支持多维度排序,优先级按数组顺序来,你可以根据需求调整顺序(比如先按评分再按距离)。
场景2:按聚合桶内「最相关文档的评分+距离」排序
如果你的需求是每个产品组的排序依据是组内最匹配、距离最近的那篇文档的评分和距离,那么可以用top_hits聚合配合指标计算来实现。
示例DSL
我们用function_score把地理距离纳入评分计算,让_score同时体现文本匹配度和距离远近,然后取每个组内得分最高的文档,再按该文档的评分和距离排序:
GET places/test/_search { "size": 0, "query": { "function_score": { "query": { "bool": { "must": [ { "match": { "suggest": "coke" } }, { "term": { "active": true } } ] } }, "functions": [ // 用高斯衰减函数,让距离目标点越近的文档得分越高 { "gauss": { "location": { "origin": { "lat": 1.35, "lon": 103.8 }, "scale": "5km", // 5km内得分衰减慢,超过后快速衰减 "decay": 0.5 // 衰减系数,值越小衰减越快 } } } ], "boost_mode": "multiply" // 原始匹配得分 × 距离衰减得分,得到最终_score } }, "aggs": { "group_by_product": { "terms": { "field": "id_product", "order": [ { "top_hit_score": "desc" }, // 第一排序:最相关文档的得分降序 { "top_hit_distance": "asc" } // 第二排序:最相关文档的距离升序 ] }, "aggs": { // 获取每个组内得分最高、距离最近的1篇文档 "top_relevant_doc": { "top_hits": { "size": 1, "sort": [ { "_score": "desc" }, { "_geo_distance": { "location": { "lat": 1.35, "lon": 103.8 }, "order": "asc", "unit": "km" } } ] } }, // 提取最相关文档的得分 "top_hit_score": { "max": { "script": "_score" } }, // 计算最相关文档到目标点的距离(单位:km) "top_hit_distance": { "min": { "script": { "source": "doc['location'].arcDistance(params.lat, params.lon) / 1000", "params": { "lat": 1.35, "lon": 103.8 } } } } } } } }
关键部分解释
function_score:把地理距离作为得分的一部分,让_score同时兼顾文本匹配度和距离,更符合“综合相关度”的需求。top_hits:精准获取每个组内最符合要求的文档,方便后续基于该文档的指标排序。script计算距离:通过arcDistance方法计算文档坐标到目标点的直线距离(转成km),确保排序的准确性。
注意事项
- 替换示例中的目标坐标(
origin里的lat和lon)为你实际需要的中心点。 - 调整
distance_type:短距离(比如几十公里内)用plane足够快,长距离建议用arc保证精度。 - 排序维度的顺序可以完全根据你的业务需求调整,比如把评分优先级放在距离前面。
- 如果你的文档有独立的评分字段(比如
rating),可以把avg_score换成对该字段的聚合(比如avg: { field: "rating" })。
内容的提问来源于stack exchange,提问作者woshitom
相关产品推荐
相关产品推荐

