Elasticsearch 1.7中uax_url_email分词器拆分邮箱问题求助
嘿,我看了你配置的Elasticsearch分析器和测试结果,明明用了uax_url_email分词器,邮箱还是被@拆成两个token,这大概率是几个常见的配置坑导致的,我帮你梳理一下:
1. 索引模板没生效到已存在的索引上
你的模板是给someindex*这类索引用的,但如果someindex这个索引是在你创建模板之前就已经存在了,那模板里的分析器配置根本不会自动套用到这个老索引上——Elasticsearch的模板只对模板创建后新建的索引生效。
怎么验证?
先查一下someindex当前的配置,看看你写的email-analyzer和email-tokenizer是不是真的加载进去了:
curl -XGET 'http://localhost:9200/someindex/_settings?pretty'
如果返回的结果里找不到这两个配置,那就是模板没生效的问题。
解决办法
如果数据可以备份重建的话,先删掉旧索引:
curl -XDELETE 'http://localhost:9200/someindex'
之后要么手动创建索引,要么随便插一条数据,Elasticsearch会自动匹配模板创建新索引,这时候再跑你的测试命令,应该就能看到完整的邮箱token了。
2. 确认分词器的实际使用情况
你测试返回的token类型是<ALPHANUM>,但正常uax_url_email分词器处理邮箱后,token类型应该是<EMAIL>,这说明你的email-analyzer根本没被用上,实际用的还是默认的标准分词器。这也侧面印证了第一个问题——模板没生效,索引里根本没这个自定义分析器。
3. 再核对下模板配置的细节
你的模板配置本身是没问题的,但可以再检查下拼写:
- 确保
email-tokenizer的类型确实是uax_url_email,没有打错字:"index.analysis.tokenizer.email-tokenizer.type" : "uax_url_email" - 确保
email-analyzer正确关联了这个tokenizer:"index.analysis.analyzer.email-analyzer.tokenizer" : "email-tokenizer"
正确生效后的预期结果
如果配置没问题且模板生效了,测试命令会返回这样的结果:
{"tokens":[{"token":"test.me@gmail.com","start_offset":0,"end_offset":17,"type":"<EMAIL>","position":1}]}
另外补充个小技巧:如果只是单纯想让邮箱字段完全不拆分,也可以直接用keyword分词器(把整个字符串当成一个token),不过uax_url_email更适合同时处理邮箱和URL的场景。
内容的提问来源于stack exchange,提问作者al.

