使用NLTK的RegexpTokenizer时遇错误,求解决方法
错误解决方案
问题原因
代码里RegexpTokenizer的正则表达式写错了:r'w+'中的w不是正则元字符,它只会匹配连续的字母"w",完全无法实现提取文本单词的分词效果,这就是结果不符合预期的核心原因。
修正后的代码
from nltk.tokenize import RegexpTokenizer # 修正正则表达式,使用正则元字符\w tokenizer = RegexpTokenizer(r'\w+') dataset['text'] = dataset['text'].apply(tokenizer.tokenize) dataset['text'].head()
说明
正则表达式r'\w+'里的\w是标准正则元字符,代表匹配任意字母、数字或下划线的组合,这样就能正确提取文本中的单词类内容,得到预期的分词结果。
内容的提问来源于stack exchange,提问作者Sahil Patil0005
相关产品推荐
相关产品推荐

