Python实现从文本列表提取不重复单词的方法求助
实现文本单词去重的解决方案
一、用循环手动去重(匹配你的需求)
在你已有的代码基础上,只需在wdlst = list()之后添加循环逻辑,遍历拆分后的单词列表,判断单词是否已存在于无重复列表中,不存在则添加:
fname = input("Enter file name: ") try : fh = open(fname) except : print("Enter a valid file name: ") quit() fread = fh.read() fstrip = fread.rstrip() fsplit = fstrip.split() lst = list(fsplit) # 实现去重的循环 wdlst = list() for word in lst: # 检查当前单词是否不在无重复列表中 if word not in wdlst: wdlst.append(word) # 打印去重后的单词列表 print(wdlst)
补充:忽略大小写去重
如果需要把Romeo和romeo视为同一个单词,可以统一转换为小写后判断:
wdlst = list() for word in lst: lower_word = word.lower() if lower_word not in wdlst: wdlst.append(lower_word)
二、更简洁的Python内置方法
如果不需要手动写循环,Python有更高效的去重方式:
- 使用集合(自动去重,但不保留顺序)
wdlst = list(set(lst))
- 使用字典保持顺序(Python 3.7+支持)
如果需要保留单词第一次出现的顺序,可以用dict.fromkeys:
wdlst = list(dict.fromkeys(lst))
内容的提问来源于stack exchange,提问作者James Hill
相关产品推荐
相关产品推荐

