为何用NLTK统计Reuters语料库单词数为1720901而非约130万?
Reuters语料库单词统计结果差异的原因
- 包含非单词元素:
nltk.corpus.reuters.words()的返回结果里,除了常规英文单词,还将标点符号、数字、特殊符号(比如逗号、句号、数字串)全部计入统计。而你所说的130万的"正确结果",一般指仅统计纯词汇、排除这类非单词元素后的数量。 - 额外文本被计入:NLTK打包的Reuters语料库可能包含了文档头、标注信息等辅助内容,甚至存在少量重复收录的文档,这些内容都被
words()方法纳入了统计范围,拉高了总数。 - 语料库版本差异:不同版本的NLTK Reuters语料库在收录范围、预处理逻辑上可能有区别。你使用的版本可能比参考版本收录了更多文档,或者预处理时没有过滤掉部分内容,最终导致统计结果出现偏差。
内容的提问来源于stack exchange,提问作者saeedJamaly
相关产品推荐
相关产品推荐

