Django 2.0+PostgreSQL 9.6.1全文搜索:如何处理带重音文本
解决Django+PostgreSQL中带重音词汇的全文搜索问题
嘿,我刚好踩过这个坑,这就给你一步步拆解解决方案:
1. 确认unaccent扩展已正常生效
虽然你说已经安装完成,还是可以在PostgreSQL命令行里跑这条命令确保万无一失:
CREATE EXTENSION IF NOT EXISTS unaccent;
如果之前没装,这条会自动帮你安装;已经装了的话也不会报错。
2. 创建自定义的「无重音」全文搜索配置
接下来要在PostgreSQL里定义一个新的全文搜索配置,把unaccent作为预处理步骤。假设我们基于英文配置来创建,执行以下SQL:
-- 复制默认的english配置,创建自定义的unaccent_english配置 CREATE TEXT SEARCH CONFIGURATION public.unaccent_english ( COPY = pg_catalog.english ); -- 修改映射规则,先执行unaccent去重音,再做英文词干处理 ALTER TEXT SEARCH CONFIGURATION public.unaccent_english ALTER MAPPING FOR hword, hword_part, word WITH unaccent, english_stem;
这样unaccent_english配置就会先把所有文本的重音去掉,再进行常规的全文搜索处理。
3. 在Django中调用自定义配置实现搜索
回到Django代码里,你只需要在SearchVector和SearchQuery中指定我们刚创建的配置即可。假设你的模型是Article,搜索代码可以这么写:
from django.contrib.postgres.search import SearchVector, SearchQuery # 构建带自定义配置的搜索向量,覆盖headline和body_text字段 vector = SearchVector('headline', 'body_text', config='unaccent_english') # 构造搜索查询,同样用自定义配置处理搜索关键词的重音 query = SearchQuery('Dhṛtarāṣṭra', config='unaccent_english') # 执行搜索并返回结果 results = Article.objects.annotate(search=vector).filter(search=query)
这样不管是数据库里存储的带重音文本,还是你输入的搜索关键词,都会先经过unaccent处理,就能精准匹配到Dhṛtarāṣṭra这类词汇了。另外注意,Django 2.0刚好支持SearchQuery的config参数,完全适配你的版本~
内容的提问来源于stack exchange,提问作者Santhosh
相关产品推荐
相关产品推荐

