Python if语句多条件判断失效及pandas apply应用问题求助
问题分析与解决方法
嘿,我一眼就揪出你函数里的问题啦!你写的条件判断犯了一个Python新手常踩的语法误区,这就是为啥单独测条件没问题,集成到函数里部分规则就失效的原因。
核心问题:or的误用
你原来的条件写法:
if ('smth' or 'smth' or 'smth') in x:
这根本不是在检查任意一个关键词是否在x中!Python里的or运算符会返回第一个“真值”(非空字符串都是真值),所以上面的代码等价于:
if 'smth' in x: # 只检查第一个字符串,后面的全被直接忽略了!
这就导致你后面的关键词完全没起到判断作用,自然会出现部分条件不生效的情况。
方案1:修正classifier函数逻辑
把条件改成用any()遍历检查每个关键词,这样就能实现“任意一个关键词存在就匹配”的需求:
def classifier(x): # 把class1的关键词统一放到列表里 class1_keywords = ['smth1', 'smth2', 'smth3'] if any(keyword in x for keyword in class1_keywords): return 'class1' # 同理处理class2的关键词 class2_keywords = ['smth4', 'smth5', 'smth6'] if any(keyword in x for keyword in class2_keywords): return 'class2' # 别忘了加默认返回值,避免出现NaN return 'other'
之后再用apply调用就正常了:
data['classes'] = data['subj'].apply(classifier)
方案2:更高效的Pandas原生写法(推荐)
如果你的数据集比较大,用apply逐行处理效率会很低。推荐用Pandas的str.contains结合np.select来实现,速度快很多:
import numpy as np # 定义条件列表和对应的分类结果 conditions = [ # 用|分隔多个关键词,实现“或”的逻辑 data['subj'].str.contains('smth1|smth2|smth3'), data['subj'].str.contains('smth4|smth5|smth6') ] choices = ['class1', 'class2'] # 应用条件,没有匹配到的返回'other' data['classes'] = np.select(conditions, choices, default='other')
注意:如果你的关键词里包含正则特殊字符(比如
.、*),记得加上regex=False参数,避免匹配出错:data['subj'].str.contains('smth.with.dot', regex=False)
内容的提问来源于stack exchange,提问作者nutcracker
相关产品推荐
相关产品推荐

