Lucene中JMdict查询如何按keb字段精确匹配优先排序?
JMdict 查询排序及回退查询问题
我正在解析JMdict的XML结构,通过keb、reb、gloss字段执行查询,文档字段设置如下:
| Document | keb | reb | gloss |
|---|---|---|---|
| A | 明日 | あした | tomorrow |
| あす | near future | ||
| みょうにち | |||
| -------- | |||
| B | 明日葉 | あしたば | Angelica keiskei (species of angelica, a herb of the parsley family) |
| 鹹草 | あしたぐさ | ||
| アシタバ |
当前使用WildcardQuery对keb字段查询明日*时,文档B排在文档A之前,但文档A的keb是精确匹配。目前仅按FIELD_SCORE排序,需要实现按以下优先级排序:
keb是否为精确匹配(布尔值,精确匹配优先)- 词条的常用度(从高到低,无常用度标记的排最后)
- Lucene分数
相关排序代码如下:
// TODO sort KEB searches by // 1. keb is exact match (boolean) // 2. commonality of entry (most common to least common, no commonality entry is least) // 3. Lucene score private static final Sort KEB_SORT = new Sort(SortField.FIELD_SCORE);
此外,我的应用中对含拉丁字符的词条(如Z検定或rkgk)会从gloss回退到keb查询,相关代码如下:
// initially TopDocs td = is.search(wildcardQuery, 1, sortForTheQuery); if(td.totalHits.value() > 0L) return td; // later TopDocs rest = is.searchAfter( initialSearch.scoreDocs[initialSearch.scoreDocs.length - 1], chain.luceneQuery(), (int) initialSearch.totalHits.value() );
内容的提问来源于stack exchange,提问作者Aly
相关产品推荐
相关产品推荐

