Python中如何缩短DataFrame筛选命令的长度?
简化Pandas DataFrame筛选条件的几种方法
当DataFrame名称较长或筛选条件复杂时,重复写df['字段']确实繁琐,以下是几种实用的简化方案:
用
query()方法(最贴近SQL/R的写法)
这是最省心的方式,语法和SQL接近,不用反复写DataFrame名:# 筛选满足条件的行并取出field3列 df.query("`field 1` == 'a' and `field 2` == 'b'")['field 3']字段名带空格的话用反引号包裹;要引用外部变量的话,在变量前加
@:target_a = 'a' target_b = 'b' df.query("`field 1` == @target_a and `field 2` == @target_b")['field 3']拆分条件为独立变量
把每个筛选条件单独存成变量,之后组合使用,减少df的重复书写:cond_a = df['field 1'] == 'a' cond_b = df['field 2'] == 'b' df.loc[cond_a & cond_b, 'field 3']这种方式在条件多的时候更清晰,也方便单独验证每个条件是否正确。
用
eval()生成布尔掩码
通过eval()解析字符串条件得到布尔索引,再传入loc筛选:filter_mask = df.eval("`field 1` == 'a' & `field 2` == 'b'") df.loc[filter_mask, 'field 3']适合需要先拿到掩码做进一步处理的场景,灵活性更高。
内容的提问来源于stack exchange,提问作者LaTeXFan
相关产品推荐
相关产品推荐

