如何从文本文件中去除标点、空格、数字等非字母字符 现有Python代码失效
古腾堡项目文本处理代码问题修复方案
原代码问题汇总
- 缩进错误:Python强制要求代码缩进,原代码中
remove_punc函数内部逻辑、try代码块内部的文件操作逻辑均未正确缩进,运行时会直接抛出语法错误,无法正常执行。 - 变量未定义:初始读取环节定义的图书文件名为
Book_name = 'Animals.txt',后续标点清理代码直接使用了未赋值的filename变量,会触发变量未定义报错。 - 无异常捕获逻辑:
try代码块没有配套的except分支,运行出错时不会输出任何提示,无法定位失败原因。 - 标点匹配规则冗余:自定义的标点集合包含换行符、多国语言特殊字符、数字等内容,若只需清理常规标点可简化规则,该问题不影响代码运行,仅会影响处理结果。
修正后的可运行代码
def remove_punc(string): punc = '''!()-[]{};:'"\, <>./?@#$%^&*_~12345678“90σ\nθμνëη=χéὁλςπε”οκ£ι§ρτυαωæδàγψ''' for ele in string: if ele in punc: string = string.replace(ele, "") return string filename = 'Animals.txt' # 补充定义文件名变量 try: with open(filename,'r',encoding="utf-8") as f: data = f.read() with open(filename,"w+",encoding="utf-8") as f: f.write(remove_punc(data)) print("Removed punctuations from the file", filename) except Exception as e: print("运行出错,错误信息:", e) # 增加异常打印,方便定位问题
更简洁的替代实现方案
调用Python内置string模块的标点集合,无需手动枚举所有标点,兼容性更强:
import string def remove_punc(string): # 可根据需求调整要过滤的字符范围,此处默认过滤标点、数字、换行符、中文引号 all_punc = string.punctuation + string.digits + '\n“”‘’' return ''.join([char for char in string if char not in all_punc]) filename = 'Animals.txt' try: with open(filename,'r',encoding="utf-8") as f: data = f.read() # 建议保存为新文件,避免覆盖原文件丢失原始数据 with open(f"clean_{filename}","w+",encoding="utf-8") as f: f.write(remove_punc(data)) print(f"已完成文件标点清理,清理后文件名为 clean_{filename}") except Exception as e: print("处理出错:", e)
注:处理古腾堡文本时,建议先过滤开头和末尾的项目官方版权说明文本,再做标点清理等后续操作,避免无效内容干扰统计结果。
内容的提问来源于stack exchange,提问作者Theodora Martha
相关产品推荐
相关产品推荐

