You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python实现从文本列表提取不重复单词的方法求助

实现文本单词去重的解决方案

一、用循环手动去重(匹配你的需求)

在你已有的代码基础上,只需在wdlst = list()之后添加循环逻辑,遍历拆分后的单词列表,判断单词是否已存在于无重复列表中,不存在则添加:

fname = input("Enter file name: ")

try :
    fh = open(fname)
except : 
    print("Enter a valid file name: ")
    quit()

fread = fh.read()
fstrip = fread.rstrip()
fsplit = fstrip.split()
lst = list(fsplit)

# 实现去重的循环
wdlst = list()
for word in lst:
    # 检查当前单词是否不在无重复列表中
    if word not in wdlst:
        wdlst.append(word)

# 打印去重后的单词列表
print(wdlst)

补充:忽略大小写去重

如果需要把Romeo和romeo视为同一个单词,可以统一转换为小写后判断:

wdlst = list()
for word in lst:
    lower_word = word.lower()
    if lower_word not in wdlst:
        wdlst.append(lower_word)

二、更简洁的Python内置方法

如果不需要手动写循环,Python有更高效的去重方式:

  1. 使用集合(自动去重,但不保留顺序)
wdlst = list(set(lst))
  1. 使用字典保持顺序(Python 3.7+支持)
    如果需要保留单词第一次出现的顺序,可以用dict.fromkeys:
wdlst = list(dict.fromkeys(lst))

内容的提问来源于stack exchange,提问作者James Hill

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.11 16:25:35