You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Elasticsearch 5.2.0中正确设置索引以实现音译与词形还原?

Elasticsearch 5.2.0 词形还原索引配置实践

最近我在试着给Elasticsearch 5.2.0配置合适的索引,目的是充分发挥词形还原的优势,目前我写的索引配置代码如下:

PUT /icu 
{ 
  "settings":{ 
    "index":{ 
      "analysis":{ 
        "filter":{ 
          "latin_transform":{ 
            "type":"icu_transform", 
            "id":"Any-Latin; Lower()" 
          }, 
          "lemmagen_filter_sr":{ 
            "type":"lemmagen", 
            "lexicon":"sr" 
          } 
        }, 
        "analyzer":{ 
          "lemmagen_lowercase_sr":{ 
            "filter":["lemmagen_filter_sr", "latin_transform"], 
            "type":"custom", 
            "tokenizer":"standard" 
          } 
        } 
      } 
    } 
  } 
}

简单拆解下这个配置的思路:

  • 定义了latin_transform过滤器,采用icu_transform类型,实现将任意字符转换为拉丁字符并统一转为小写的效果
  • 配置了lemmagen_filter_sr过滤器,借助lemmagen插件针对塞尔维亚语(sr)完成词形还原处理
  • 最后自定义了lemmagen_lowercase_sr分析器,将上述两个过滤器组合起来,搭配standard分词器使用

内容的提问来源于stack exchange,提问作者bigcat

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 09:48:51