ElasticSearch无撇号输入匹配带撇号内容配置失效问题
问题原因
你的配置不生效是两个核心错误导致的:
- 正则转义写错了:你在索引配置里用
"""(Kibana DevTools的原始字符串语法)定义正则pattern时,多写了一层反斜杠。普通JSON字符串里正则的\s需要转义成\\s才能被识别为空白符元字符,但原始字符串里反斜杠不需要转义,你写的\\s会被正则引擎识别为匹配字面量的\s字符(也就是反斜杠加字母s),正常文本里根本不存在这个字符,所以你的字符过滤规则完全没生效,不会生成johns这个token。 - 配置未对存量文档生效:ES的分词是在文档写入时完成的,修改分析器配置不会自动对已经写入的文档重新分词,必须重建索引、执行reindex把存量数据导到新索引,新的分词规则才会生效。
另外你写的正则里前导的\s*完全没必要,去掉不影响匹配效果,还能减少转义出错的概率。
正确配置示例
PUT /your_target_index { "settings": { "analysis": { "analyzer": { "my_custom_search": { "char_filter": [ "flexible_plurals" ], "tokenizer": "standard" } }, "char_filter": { "flexible_plurals": { "type": "pattern_replace", // DevTools三引号原始字符串写法,不需要额外转义反斜杠,去掉了多余的前导空白匹配 "pattern": """([a-zA-Z0-9]+)'s""", // 如果是标准JSON提交(不用三引号),pattern值直接写"([a-zA-Z0-9]+)'s"即可 "replacement": " $1 $1s $1's " } } } }, "mappings": { "properties": { "search-terms": { "type": "text", "analyzer": "my_custom_search" } } } }
验证&使用步骤
- 创建完索引后,先调用_analyze接口验证分词结果是否符合预期:
确认返回的token列表包含GET /your_target_index/_analyze { "analyzer": "my_custom_search", "text": "john's dog jumped" }john、johns、john's三个值,再进行下一步。 - 将业务数据通过
_reindex接口导入到新索引中,不要直接复用修改配置前的旧索引。 - 正常使用match查询搜索
johns,即可匹配到包含John's的文档。
简化方案(可选)
如果不需要区分john、johns、john's的相关性差异,可以直接用更简单的撇号移除规则,不需要做token展开,配置更不容易出错:
"char_filter": { "remove_apostrophe": { "type": "pattern_replace", "pattern": "'", "replacement": "" } }
这个规则会把所有撇号直接删除,John's会被分词为johns,无论用户搜johns还是john's(搜索时撇号也会被同步删除)都能正常匹配。
内容的提问来源于stack exchange,提问作者Sepehr Sabbagh-pour
相关产品推荐
相关产品推荐

