Python Pandas基于双列条件筛选违反校验规则的行
问题描述
我有如下示例数据表:
现有数据校验规则:若your_pack_size与competitor_pack_size取值相等,则your_measurement与competitor_measurement取值不可相等。需要查找所有违反该规则的行(若存在)。
已尝试编写如下代码实现需求:
if (df_pr['your_pack_size'].any() == df_pr['competitor_pack_size'].any()): print('your_pack_size is the same as competitor_pack_size') print(df_pr.loc[df_pr['your_pack_size'].any() == df_pr['competitor_pack_size'].any()]['competitor_product_id'])
运行上述代码时出现报错,需要正确实现需求,打印输出所有违反规则行对应的competitor_product_id值。
错误原因
原代码误用了.any()方法:该方法的作用是判断序列中是否存在至少一个真值,返回单个布尔结果,无法实现逐行对比两列取值的效果,因此筛选逻辑完全不成立。
正确实现方案
违规行的逐行判定逻辑为:
- 同一行内
your_pack_size等于competitor_pack_size - 且同一行内
your_measurement等于competitor_measurement
直接通过布尔索引筛选符合条件的行即可,无需额外写外层if判断,代码如下:
# 生成逐行匹配的违规条件 violate_mask = ( (df_pr['your_pack_size'] == df_pr['competitor_pack_size']) & (df_pr['your_measurement'] == df_pr['competitor_measurement']) ) # 提取违规行对应的competitor_product_id result = df_pr.loc[violate_mask, 'competitor_product_id'] print("违反规则的行对应competitor_product_id:") print(result)
注意事项:
- pandas中两列直接用
==对比,会返回和DataFrame行数一致的布尔序列,可直接作为.loc的筛选条件 - 组合多个筛选条件时,每个条件必须单独用括号包裹,逻辑与用
&、逻辑或用|,不能使用Python原生的and/or关键字
内容的提问来源于stack exchange,提问作者Madda
相关产品推荐
相关产品推荐

