如何删除pandas DataFrame中任意元素包含指定字符串的列
Pandas 无效列清洗实现方案
注意:以下方案均为按列内容/数据类型做过滤,并非按列名匹配删除列。
针对1600列DataFrame的垃圾列清洗需求,提供三种可直接落地的实现方式,按需选择即可:
方案1:精准删除任意元素包含
invalid字符串的列
适用需要严格匹配错误提示关键词的场景,代码如下:# 逐列检测是否存在含"invalid"的单元格,过滤命中的列 invalid_col_mask = df.astype(str).apply(lambda col: col.str.contains('invalid', na=False)).any() df_cleaned = df.loc[:, ~invalid_col_mask]逻辑说明:先将所有单元格统一转为字符串避免类型报错,逐元素匹配目标关键词,标记出存在任意匹配项的列后整体剔除,
na=False参数会将空值判定为不匹配,不会误删含空值的正常数值列。方案2:删除所有存在字符串类型值的列
适用允许直接剔除所有含字符串列的场景,代码最简洁:# 排除所有object、string类型的列 df_cleaned = df.select_dtypes(exclude=['object', 'string'])逻辑说明:只要列中混入字符串值,pandas会自动将该列类型标记为
object或string,该方法可一次性过滤所有混有字符串提示的列。方案3:仅保留布尔型、实数型列(机器学习训练优先选)
直接对齐模型训练的数据类型要求,一步完成清洗:# 仅保留数值类(整数、浮点数等实数)、布尔类型列 df_cleaned = df.select_dtypes(include=['number', 'bool'])逻辑说明:pandas内置的
select_dtypes方法会按列的实际数据类型做筛选,number类型标识会覆盖所有可参与数值计算的实数类型列,筛选结果可直接输入后续机器学习流程,无需额外类型转换。
内容的提问来源于stack exchange,提问作者Charlie Crown
相关产品推荐
相关产品推荐

