You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python合并两个TXT文件中带[not done]标签的去重内容

Python脚本实现合并去重带[not done]标签的TXT内容

以下是实现需求的Python脚本,逻辑清晰且高效:

# 定义要处理的输入文件路径
input_files = ["File1.txt", "File2.txt"]
output_file = "result.txt"

# 使用集合存储去重后的目标行,集合自动处理重复项
unique_not_done = set()

# 遍历每个输入文件
for file_path in input_files:
    with open(file_path, 'r', encoding='utf-8') as f:
        # 逐行读取文件内容
        for line in f:
            # 去除行首尾空白字符(避免因换行/空格导致的重复判断错误)
            stripped_line = line.strip()
            # 判断该行是否包含[not done]标签
            if "[not done]" in stripped_line:
                # 将处理后的行加入集合(自动去重)
                unique_not_done.add(stripped_line)

# 将去重后的内容写入结果文件
with open(output_file, 'w', encoding='utf-8') as f:
    # 遍历集合中的每一行,写入文件并添加换行符
    for line in unique_not_done:
        f.write(line + '\n')

脚本说明:

  • 去重逻辑:利用Python的set(集合)特性,自动过滤重复的行,无需手动对比
  • 文件读取:使用with语句处理文件,确保文件自动关闭,避免资源泄漏
  • 行处理:用strip()去除每行首尾的空白字符(包括换行符、空格),防止因格式差异导致的重复误判
  • 编码处理:指定encoding='utf-8'确保文件读写时的编码一致性,避免乱码

可选优化:

如果需要保留行的首次出现顺序(集合是无序的),可以将集合转为有序结构(Python 3.7+支持):

# 替换写入前的集合处理逻辑,保留首次出现顺序
unique_not_done = list(dict.fromkeys(unique_not_done))

内容的提问来源于stack exchange,提问作者Megan Darcy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.14 13:55:20