如何将Pandas DataFrame中的不完整元组替换为np.nan
原因说明
直接调用df.replace(to_replace=t, value=np.nan)无法生效,核心原因是pandas对object类型列存储的元组这类非标量值做全局替换时,内部默认的快速匹配逻辑不会逐单元格做对象等值校验,受类型推断、广播机制影响很容易漏匹配。
可行方案
你不需要提前知道具体列名,只要匹配word_score_前缀筛选目标列即可,以下两种方法都能稳定完成替换:
- 方法1:逐列掩码替换(性能最好,推荐)
先定义待替换的异常元组,筛选出所有目标列后逐列做等值判断,不符合条件的位置保留原值,命中异常值的位置替换为np.nan:import numpy as np import pandas as pd bad_val = ("", 1e-05) # 筛选所有以word_score_开头的列 target_cols = df.columns[df.columns.str.startswith("word_score_")] for col in target_cols: df[col] = df[col].where(df[col] != bad_val, np.nan) - 方法2:全表逐元素替换(代码最简洁)
如果要替换全表所有位置的这类异常元组,不需要筛选列,可以直接逐元素判断替换:import numpy as np import pandas as pd bad_val = ("", 1e-05) # pandas 2.1.0以下版本用applymap,以上版本直接用df.map df = df.applymap(lambda x: np.nan if x == bad_val else x)
结果验证
用提供的复现数据测试,替换后查看原异常位置的取值:
print(df.loc[30, "word_score_1"]) # 输出 nan print(df.loc[41, "word_score_1"]) # 输出 nan
两个位置的异常元组都会被正确替换为空值。
内容的提问来源于stack exchange,提问作者leifericf
相关产品推荐
相关产品推荐

