You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从文本文件中去除标点、空格、数字等非字母字符 现有Python代码失效

古腾堡项目文本处理代码问题修复方案

原代码问题汇总

  • 缩进错误:Python强制要求代码缩进,原代码中remove_punc函数内部逻辑、try代码块内部的文件操作逻辑均未正确缩进,运行时会直接抛出语法错误,无法正常执行。
  • 变量未定义:初始读取环节定义的图书文件名为Book_name = 'Animals.txt',后续标点清理代码直接使用了未赋值的filename变量,会触发变量未定义报错。
  • 无异常捕获逻辑:try代码块没有配套的except分支,运行出错时不会输出任何提示,无法定位失败原因。
  • 标点匹配规则冗余:自定义的标点集合包含换行符、多国语言特殊字符、数字等内容,若只需清理常规标点可简化规则,该问题不影响代码运行,仅会影响处理结果。

修正后的可运行代码

def remove_punc(string):
    punc = '''!()-[]{};:'"\, <>./?@#$%^&*_~12345678“90σ\nθμνëη=χéὁλςπε”οκ£ι§ρτυαωæδàγψ'''
    for ele in string:  
        if ele in punc:  
            string = string.replace(ele, "") 
    return string

filename = 'Animals.txt' # 补充定义文件名变量
try:
    with open(filename,'r',encoding="utf-8") as f:
        data = f.read()
    with open(filename,"w+",encoding="utf-8") as f:
        f.write(remove_punc(data))
    print("Removed punctuations from the file", filename)
except Exception as e:
    print("运行出错,错误信息:", e) # 增加异常打印,方便定位问题

更简洁的替代实现方案

调用Python内置string模块的标点集合,无需手动枚举所有标点,兼容性更强:

import string

def remove_punc(string):
    # 可根据需求调整要过滤的字符范围,此处默认过滤标点、数字、换行符、中文引号
    all_punc = string.punctuation + string.digits + '\n“”‘’'
    return ''.join([char for char in string if char not in all_punc])

filename = 'Animals.txt'
try:
    with open(filename,'r',encoding="utf-8") as f:
        data = f.read()
    # 建议保存为新文件,避免覆盖原文件丢失原始数据
    with open(f"clean_{filename}","w+",encoding="utf-8") as f:
        f.write(remove_punc(data))
    print(f"已完成文件标点清理,清理后文件名为 clean_{filename}")
except Exception as e:
    print("处理出错:", e)

注:处理古腾堡文本时,建议先过滤开头和末尾的项目官方版权说明文本,再做标点清理等后续操作,避免无效内容干扰统计结果。

内容的提问来源于stack exchange,提问作者Theodora Martha

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 13:54:03