如何用Python合并两个TXT文件中带[not done]标签的去重内容
Python脚本实现合并去重带[not done]标签的TXT内容
以下是实现需求的Python脚本,逻辑清晰且高效:
# 定义要处理的输入文件路径 input_files = ["File1.txt", "File2.txt"] output_file = "result.txt" # 使用集合存储去重后的目标行,集合自动处理重复项 unique_not_done = set() # 遍历每个输入文件 for file_path in input_files: with open(file_path, 'r', encoding='utf-8') as f: # 逐行读取文件内容 for line in f: # 去除行首尾空白字符(避免因换行/空格导致的重复判断错误) stripped_line = line.strip() # 判断该行是否包含[not done]标签 if "[not done]" in stripped_line: # 将处理后的行加入集合(自动去重) unique_not_done.add(stripped_line) # 将去重后的内容写入结果文件 with open(output_file, 'w', encoding='utf-8') as f: # 遍历集合中的每一行,写入文件并添加换行符 for line in unique_not_done: f.write(line + '\n')
脚本说明:
- 去重逻辑:利用Python的
set(集合)特性,自动过滤重复的行,无需手动对比 - 文件读取:使用
with语句处理文件,确保文件自动关闭,避免资源泄漏 - 行处理:用
strip()去除每行首尾的空白字符(包括换行符、空格),防止因格式差异导致的重复误判 - 编码处理:指定
encoding='utf-8'确保文件读写时的编码一致性,避免乱码
可选优化:
如果需要保留行的首次出现顺序(集合是无序的),可以将集合转为有序结构(Python 3.7+支持):
# 替换写入前的集合处理逻辑,保留首次出现顺序 unique_not_done = list(dict.fromkeys(unique_not_done))
内容的提问来源于stack exchange,提问作者Megan Darcy
相关产品推荐
相关产品推荐

