Python下为FastText清理爬取语料、解决单词粘连问题的方案咨询
通用处理流程
- 批量筛选异常词,缩小处理范围
先统计全语料的词频,设定合理的频率阈值,仅把出现频率低于阈值的词汇纳入待处理队列。正常通用词、领域专有词的出现频率普遍较高,这一步可以过滤掉90%以上无需处理的有效词汇,大幅降低后续工作量。 - 自动拆分粘连词
使用专门的英文粘连词拆分工具处理异常词,这类工具基于预训练的英文词库和词汇共现概率模型,可以自动把passquarterback、smartidea这类粘连词拆分为独立的正确词汇,处理效率远高于人工校验。 - 适配领域专有词提升准确率
把NFL领域的专有名词(包括球员名字、战术术语、球队名称等)加入拆分工具的自定义词库,可大幅降低领域相关粘连词的拆分错误率。 - 低置信度结果人工兜底
自动处理完成后,仅导出拆分置信度低于阈值、长度异常的词汇做人工校验,仅需处理极少量的边缘情况。 - 补充拼写纠错优化语料
粘连问题处理完成后,可以再做一轮全局拼写纠错,修正vsmart这类单字符拼写错误的脏数据,之后再训练FastText模型即可避免无效近邻结果的问题。
可用工具包
- 粘连词拆分:wordninja、symspell、spaCy CompoundWordSplitter扩展
- 拼写纠错:symspell、autocorrect、textblob
- 词频筛选:Python原生collections.Counter、pandas的value_counts方法
内容的提问来源于stack exchange,提问作者Michael Martin
相关产品推荐
相关产品推荐

