如何在Elasticsearch 5.2.0中正确设置索引以实现音译与词形还原?
Elasticsearch 5.2.0 词形还原索引配置实践
最近我在试着给Elasticsearch 5.2.0配置合适的索引,目的是充分发挥词形还原的优势,目前我写的索引配置代码如下:
PUT /icu { "settings":{ "index":{ "analysis":{ "filter":{ "latin_transform":{ "type":"icu_transform", "id":"Any-Latin; Lower()" }, "lemmagen_filter_sr":{ "type":"lemmagen", "lexicon":"sr" } }, "analyzer":{ "lemmagen_lowercase_sr":{ "filter":["lemmagen_filter_sr", "latin_transform"], "type":"custom", "tokenizer":"standard" } } } } } }
简单拆解下这个配置的思路:
- 定义了
latin_transform过滤器,采用icu_transform类型,实现将任意字符转换为拉丁字符并统一转为小写的效果 - 配置了
lemmagen_filter_sr过滤器,借助lemmagen插件针对塞尔维亚语(sr)完成词形还原处理 - 最后自定义了
lemmagen_lowercase_sr分析器,将上述两个过滤器组合起来,搭配standard分词器使用
内容的提问来源于stack exchange,提问作者bigcat
相关产品推荐
相关产品推荐

