Python NLTK报错TypeError: unhashable type: 'list' 如何解决?
解决TypeError: unhashable type: 'list'问题
嘿,我来帮你搞定这个报错!咱们先拆解一下问题出在哪:
你这段代码里,tokens是一个嵌套列表——因为你遍历每个文档时,把word_tokenize(each)的结果(这本身是一个列表)直接append到了tokens里,所以tokens最终是[[词1, 词2...], [词a, 词b...], ...]这种结构。
而当你用列表推导式[w for w in tokens if not w in stop_words]的时候,w取到的是每个子列表,可stop_words是个字符串集合,列表属于「不可哈希(unhashable)」的类型,根本没法和集合里的字符串做成员判断,这就触发了TypeError: unhashable type: 'list'。
另外还有个小拼写错误:word_tokenize(eac)应该是word_tokenize(each),这个先补上!
修正方案一:扁平化嵌套列表后过滤
先把所有分词结果整合成一维列表,再过滤停用词:
from nltk.corpus import stopwords from nltk.tokenize import word_tokenize import re # 用with语句处理文件更安全,不用手动关闭 with open('cran.all.1400', 'r+') as fo: contents = fo.read() # 拆分文档,顺便过滤掉拆分后可能出现的空字符串 docs = [doc for doc in re.split(r'\.I\s\d+', contents) if doc.strip()] stop_words = set(stopwords.words('english')) tokens = [] for each in docs: # 修正拼写错误,分词当前文档 doc_tokens = word_tokenize(each) tokens.append(doc_tokens) # 扁平化嵌套列表,同时转小写再过滤(stopwords都是小写,避免漏过滤大写词) s_words = [w.lower() for sublist in tokens for w in sublist if w.lower() not in stop_words] print(s_words)
修正方案二:分词时直接过滤(更高效)
不用先存所有分词结果,在遍历每个文档时就直接过滤停用词,节省内存:
from nltk.corpus import stopwords from nltk.tokenize import word_tokenize import re with open('cran.all.1400', 'r+') as fo: contents = fo.read() docs = [doc for doc in re.split(r'\.I\s\d+', contents) if doc.strip()] stop_words = set(stopwords.words('english')) s_words = [] for each in docs: doc_tokens = word_tokenize(each) # 直接过滤当前文档的停用词,转小写保证匹配 filtered = [w.lower() for w in doc_tokens if w.lower() not in stop_words] # 用extend把过滤后的词加入总列表,而不是append整个子列表 s_words.extend(filtered) print(s_words)
额外注意事项
- 运行前记得先下载NLTK的必要数据集,不然会报错:
import nltk nltk.download('stopwords') nltk.download('punkt') - 正则表达式
r'\.I\s\d+'比原来的r'\.I[\s][\d]*'更严谨,匹配.I加空格加数字的格式,避免不必要的拆分。
内容的提问来源于stack exchange,提问作者Muhammad Burhan
相关产品推荐
相关产品推荐

