如何替换文本文件的箭头字符、空行与重复表头并将数据干净导入Excel
问题排查与修复方案
现有代码的核心问题
- 读写同一文件的模式逻辑错误
第二段代码使用r+模式打开MICnew.txt时,遍历读取文件行的过程中文件指针会不断向后移动,此时执行写入操作只会将内容追加到文件末尾,原有未处理的内容不会被修改或清除,最终看起来文件内容没有变化。 - 功能缺失
现有代码仅实现了非ASCII字符替换,没有补充重复表头过滤的逻辑,无法完整满足需求。 - 隐式编码问题
打开文件时没有指定编码,不同系统默认编码不同可能导致读取文件内容异常。
修复后代码
下面的代码将字符替换、空行过滤、重复表头过滤逻辑合并到单次遍历中,不需要重复打开文件,运行效率更高,也避免了读写指针错乱的问题:
import re # 存储表头内容用于去重 header = None with open('MIC.txt', 'r', encoding='utf-8') as old_f, open('MICnew.txt', 'w', encoding='utf-8') as new_f: for line in old_f: # 替换所有非ASCII字符(包含箭头字符)为空格 cleaned_line = re.sub(r'[^\x00-\x7F]', ' ', line) # 过滤空行 if cleaned_line.isspace(): continue # 过滤重复表头:默认第一行非空内容为表头,后续相同行直接跳过 if header is None: header = cleaned_line.strip() new_f.write(cleaned_line) continue if cleaned_line.strip() == header: continue # 写入处理完成的正常数据行 new_f.write(cleaned_line)
如果你只需要替换特定的箭头字符而不是所有非ASCII内容,可以把正则规则替换成箭头对应的匹配规则即可。
内容的提问来源于stack exchange,提问作者Shri
相关产品推荐
相关产品推荐

