如何使用Notepad++查找词典中未在目标文件中出现的单词
Notepad++ 筛选词典未出现在书籍文本中单词的操作步骤
1. 预处理两个文件
- 打开词典词表文件,确保每行只有1个独立单词,删除行前后多余空格、标点,用「编辑」->「转换大小写」功能批量统一全小写/全大写,避免大小写导致匹配失败。
- 打开书籍文本文件,按
Ctrl+H调出查找替换面板,把所有非字母字符(标点、数字、空格、特殊符号)统一替换为换行符,处理成每行1个单词的格式,同样统一大小写,和词典的格式保持完全一致。
2. 批量标记词典中已在书籍里出现的单词
- 切换到预处理后的书籍文本文件,按
Ctrl+A全选所有内容,Ctrl+C复制。 - 新建一个临时空白标签页,粘贴刚才复制的内容,再次按
Ctrl+H调出替换面板:- 查找目标填写
\r?\n - 替换为填写
| - 查找模式选择「扩展(\n,\r,\t...)」
- 点击「全部替换」,得到用
|分隔的所有书籍单词列表,全选复制这个内容。
- 查找目标填写
- 切换回预处理后的词典词表文件,点击菜单栏的「搜索」->「标记」,调出标记面板:
- 「查找目标」输入框右键粘贴刚才得到的用|分隔的单词串
- 依次勾选「匹配整词」、「区分大小写」(和之前统一大小写的规则匹配即可)、「书签行」、「正则表达式」选项
- 点击「全部标记」,此时所有在书籍中出现过的词典单词所在行都会被加上书签。
3. 提取未出现的单词
- 标记完成后,点击词典文件的菜单栏「搜索」->「书签」->「删除书签行」。
- 此时文件中剩余的所有行就是词典中从未在书籍文本里出现过的单词,直接保存即可。
注意事项
- 如果书籍单词量超过1万,建议拆分成2-3批分别生成|分隔的单词串,分批标记,避免正则匹配长度超限导致软件卡顿或匹配失败。
- 部分特殊拼写的单词如果有特殊符号,预处理阶段要单独处理,避免匹配遗漏。
内容的提问来源于stack exchange,提问作者Moshiur Rahman
相关产品推荐
相关产品推荐

