You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何以更Pythonic的方式替换DataFrame指定列外的空字符串

无循环替换DataFrame指定列外的全空白值为np.nan

需求说明

给定如下示例DataFrame:

data = {'Header One' : ['  ','assda','thisisatest','20230606'],
        'Header Two' : ['xx ','hahah','thisistest','20230706'],
        'Header Three' : ['  ','a--s==sda',' is a test','20230603'],
        'Header Four': [' xx2', '\n', 'thisiatest', '20230609']}
df = pd.DataFrame(data)

需要替换除Header Two列外所有列的全空白值(包括纯空格、换行符等仅含空白字符的值)为np.nan,替代原有的循环实现方式。

无循环实现方案

这里提供两种简洁的Pythonic写法:

方法一:使用df.update()批量更新

import pandas as pd
import numpy as np

# 筛选出需要处理的列(排除Header Two),执行替换后更新原DataFrame
df.update(df.drop("Header Two", axis=1).replace(r'^\s*$', np.nan, regex=True))

df.drop("Header Two", axis=1)获取所有需要处理的列,执行正则替换后,通过update()将替换结果同步回原DataFrame,Header Two列全程不受影响。

方法二:直接定位目标列赋值

# 直接选中除Header Two外的所有列,批量执行替换并赋值
df.loc[:, df.columns != "Header Two"] = df.loc[:, df.columns != "Header Two"].replace(r'^\s*$', np.nan, regex=True)

通过df.loc[:, df.columns != "Header Two"]一次性选中所有目标列,直接替换后赋值,全程无需循环。

原concat方案的问题分析

你之前尝试的pd.concat写法存在两个错误:

  1. replace中使用了inplace=True,该参数会让方法返回None,导致concat的第二个元素无效;
  2. pd.concat默认按行方向拼接数据,即便去掉inplace=True,最终结果也会破坏原DataFrame的列结构,不符合需求。

内容的提问来源于stack exchange,提问作者Enchanterkeiby

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.18 22:47:49