You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Lucene中JMdict查询如何按keb字段精确匹配优先排序?

JMdict 查询排序及回退查询问题

我正在解析JMdict的XML结构,通过keb、reb、gloss字段执行查询,文档字段设置如下:

Documentkebrebgloss
A明日あしたtomorrow
あすnear future
みょうにち
--------
B明日葉あしたばAngelica keiskei (species of angelica, a herb of the parsley family)
鹹草あしたぐさ
アシタバ

当前使用WildcardQuery对keb字段查询明日*时,文档B排在文档A之前,但文档A的keb是精确匹配。目前仅按FIELD_SCORE排序,需要实现按以下优先级排序:

  • keb是否为精确匹配(布尔值,精确匹配优先)
  • 词条的常用度(从高到低,无常用度标记的排最后)
  • Lucene分数

相关排序代码如下:

// TODO sort KEB searches by
// 1. keb is exact match (boolean)
// 2. commonality of entry (most common to least common, no commonality entry is least)
// 3. Lucene score
private static final Sort KEB_SORT =
        new Sort(SortField.FIELD_SCORE);

此外,我的应用中对含拉丁字符的词条(如Z検定或rkgk)会从gloss回退到keb查询,相关代码如下:

// initially
TopDocs td = is.search(wildcardQuery, 1, sortForTheQuery);
if(td.totalHits.value() > 0L) return td;

// later
TopDocs rest = is.searchAfter(
    initialSearch.scoreDocs[initialSearch.scoreDocs.length - 1],
    chain.luceneQuery(),
    (int) initialSearch.totalHits.value()
);

内容的提问来源于stack exchange,提问作者Aly

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.14 08:42:23