Pandas代码优化与结果过滤技术问询:如何仅输出不符合利率校验条件的账户及高效实现利率匹配
解决Pandas数据筛选与条件判断的问题
关于当前代码输出全部分组数据的原因
你猜的方向有点偏差——你当前代码里用的是.any()而不是.all(),这才是问题核心!.any()的逻辑是只要分组里存在至少一个账户的利率不符合目标值,就会返回True,触发print操作,而你打印的是整个分组的所有数据,自然会把符合条件的账户也一并输出了。
更高效的优化实现
你的代码重复度很高,四个风险等级的处理逻辑几乎完全一致,而且可以直接筛选出不符合条件的行,不用先判断再打印。这里给你一个更简洁高效的实现方式:
import pandas as pd data = pd.read_pickle("data.pkl") def core_group(): # 先统一列名!注意你代码里同时出现了booked_int_rt和booked_int_rate,要保持一致 # 假设正确列名是booked_int_rt,先修正笔误 data.rename(columns={"booked_int_rate": "booked_int_rt"}, inplace=True) # 定义风险等级与目标利率的映射字典,避免重复代码 risk_target_rates = { "Risk Level 1": 0.0999, "Risk Level 2": 0.1199, "Risk Level 3": 0.1399, "Risk Level 4": 0.1499 } # 先筛选出所有pgroup为CORE的数据,减少后续分组的计算量 core_data = data[data["pgroup"] == "CORE"] for risk_level, target_rate in risk_target_rates.items(): # 筛选对应风险等级的行,再过滤出利率不符合目标值的记录 mismatched = core_data[ (core_data["pricing_risk_level"] == risk_level) & (core_data["booked_int_rt"] != target_rate) ] # 只有当存在不符合条件的记录时才输出 if not mismatched.empty: print(f"不符合{risk_level}目标利率的账户:") print(mismatched[["account_id", "pricing_risk_level", "booked_int_rt"]]) print("---") core_group()
优化点说明
- 避免重复逻辑:用字典存储风险等级和目标利率的对应关系,通过循环批量处理,代码更简洁也更容易维护(比如后续新增风险等级,只需要修改字典)。
- 直接筛选目标行:不再先获取整个分组再判断,而是直接通过布尔索引筛选出不符合条件的记录,减少不必要的数据加载和判断步骤。
- 修正列名问题:你代码里同时出现了
booked_int_rt和booked_int_rate两个列名,这会导致报错,先通过rename统一列名是关键前提。 - 减少计算量:先筛选出所有CORE分组的数据,后续只在这个子集里处理,比每次从整个数据集分组更高效。
内容的提问来源于stack exchange,提问作者HasNoName
相关产品推荐
相关产品推荐

