PostgreSQL全文搜索如何让tsvector中靠前匹配的词素获得更高排名
问题原理
PostgreSQL默认的ts_rank_cd评分逻辑优先统计匹配词条的出现频次、标注权重(如A>B>C>D)、词条相邻程度,不会优先参考词条的首次出现位置。你给出的示例中foo共出现8次、bar仅出现4次,因此默认计算下foo的匹配评分更高,符合官方默认规则。
解决方案
你可以通过自定义排序规则实现优先按首次出现位置排序的需求,PostgreSQL 13 完全支持以下方案,且不会影响原有GIN索引的命中效率:
方案1:直接优先按首次出现位置排序
如果需求是首次出现位置的优先级完全高于默认评分,可以直接提取词条的首个出现位置作为第一排序条件:
SELECT -- 替换为你需要返回的业务字段 your_column, ts_rank_cd(tsv_col, search_query) AS default_rank FROM your_table, $$'bar':* $$::tsquery AS search_query WHERE tsv_col @@ search_query -- 第一排序条件:首次出现位置升序,越早排名越前 ORDER BY (SELECT pos[1] FROM unnest(tsv_col) AS t(lexeme, positions, weights) WHERE lexeme = 'bar') ASC, -- 首次位置相同时,用默认评分排序 default_rank DESC;
注:如果使用前缀匹配的tsquery,将子查询过滤条件改为
WHERE lexeme LIKE 'bar%'即可匹配所有符合前缀的词条,取最早的出现位置。
方案2:自定义加权评分
如果需要同时参考默认评分和首次出现位置,可以把首次位置折算成权重加到评分中,你可以调整权重系数(以下示例中100为系数,可按需调整)适配业务要求:
SELECT your_column, ts_rank_cd(tsv_col, search_query) + (100 / (SELECT pos[1] FROM unnest(tsv_col) AS t(lexeme, positions, weights) WHERE lexeme = 'bar')) AS custom_rank FROM your_table, $$'bar':* $$::tsquery AS search_query WHERE tsv_col @@ search_query ORDER BY custom_rank DESC;
性能优化建议
如果数据量较大、查询频次高,可以预先将高频查询词条的首次出现位置存入单独的字段并建索引,避免查询时实时计算,进一步提升查询效率。
内容的提问来源于stack exchange,提问作者Kirill Salykin
相关产品推荐
相关产品推荐

