如何移除数据集列名中的非英文字符?
移除数据集列头中的非英文字符方案
Python(Pandas)批量处理方法
适合处理中大型数据集,自动化完成列头清理:
import pandas as pd import re # 读取目标数据集(替换为你的文件路径) df = pd.read_csv("your_dataset.csv") # 定义清理函数:仅保留英文字母、数字、空格和下划线,移除其他所有字符 def clean_col_name(col): return re.sub(r'[^a-zA-Z0-9_\s]', '', col).strip() # 批量应用清理规则到所有列名 df.columns = [clean_col_name(col) for col in df.columns] # 保存处理后的数据集 df.to_csv("cleaned_dataset.csv", index=False)
如果需要保留特定符号(比如连字符),可以调整正则表达式范围,例如改成[^a-zA-Z0-9_\s-]。
Excel 快速处理方法
适合小数据集的手动批量清理:
- 选中列头所在的整行
- 按下
Ctrl+H打开「查找和替换」对话框 - 点击「更多」,勾选「使用通配符」
- 在「查找内容」输入框填入
[^A-Za-z0-9 ] - 「替换为」输入框留空,点击「全部替换」
内容的提问来源于stack exchange,提问作者Islam Ayman Ellawendy
相关产品推荐
相关产品推荐

