You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在清洗Pandas DataFrame文本列时保留空格(仅留0-9、a-z)

解决Pandas过滤字符时保留单词空格的问题

嘿,这个问题我之前也踩过坑!你只需要在正则表达式的保留字符列表里加上空格就行啦,原来的写法把空格也当成“非允许字符”删掉了,调整一下就搞定。

核心思路

你原来的过滤逻辑应该是用了类似 str.replace(r'[^a-z0-9]', '') 的正则,这个表达式会匹配所有不是小写字母和数字的字符,自然也包括空格,所以空格被一起替换掉了。我们只需要把空格加入到“允许保留”的集合里,变成 [^a-z0-9 ](注意括号里最后加了个空格),这样就能保留单词间的空格了。

具体代码示例

import pandas as pd

# 先创建一个示例DataFrame模拟你的数据
df = pd.DataFrame({
    'text': [
        'Hello! World 123',
        'Test@#$ Multi  Space String',
        'No-symbols_here_but-need-spaces'
    ]
})

# 执行过滤:保留字母(大小写都可以,case=False)、数字和空格
df['cleaned_text'] = df['text'].str.replace(r'[^a-zA-Z0-9 ]', '', case=False)

# 如果想把多个连续空格合并成一个(可选优化)
df['cleaned_text'] = df['cleaned_text'].str.replace(r'\s+', ' ')

print(df)

执行后输出的cleaned_text列就会是:

0              Hello World 123
1        Test Multi Space String
2    No symbols here but need spaces

补充说明

  • 如果只需要保留小写字母,去掉case=False参数就行;
  • 最后的str.replace(r'\s+', ' ')是可选操作,用来处理过滤后可能出现的多个连续空格,让文本更整洁。

内容的提问来源于stack exchange,提问作者Ni_Tempe

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 10:15:31