高风险客户分群判定:含/不含目标变量哪种方法更合理?
高风险客户分群判定方法选择疑问
背景
面试作业任务:完成高风险客户分群相关工作,具体包括计算DTI(债务收入比),分析DTI在性别、婚姻状况、职业类型维度的分布,最终判定高风险分群。目前已制作两类Seaborn图表:
- 未纳入逾期标记变量
is_delinquent的图表 - 包含逾期标记目标变量的图表
核心疑问
判定高风险分群时,哪种方法更合理?实际信贷评估场景中,信贷经理无法获取逾期标记这类目标变量,仅能依赖DTI(行业通常以DTI超40%视为高风险),但纳入逾期标记后会大幅增加分群数量。
解答
1. 贴合实际业务场景:优先选择无目标变量的DTI分群法
实际信贷审批时,信贷经理根本拿不到客户未来是否逾期的数据——is_delinquent是客户借款后产生的事后标记,审批阶段完全无法获取。所以从业务落地的角度,必须采用仅基于DTI(结合性别、婚姻、职业维度的DTI分布)的分群逻辑:
- 先以行业通用的40% DTI阈值为基础,划分高/低风险基准线
- 再结合不同维度的DTI分布特征细化分群,比如某类职业群体的DTI均值普遍高于其他群体,可针对性调整该群体的风险判定标准,但核心仍不依赖逾期数据
2. 纳入逾期标记的方法:适合模型优化/事后复盘,而非直接用于审批分群
纳入is_delinquent的分群方法,本质是用事后的逾期结果倒推事前特征的风险关联,它的价值体现在:
- 用于信贷风险模型迭代优化:分析不同DTI+维度组合下的逾期率,识别哪些细分群体的逾期风险显著高于平均,从而调整后续的审批规则
- 用于事后风险复盘:评估现有分群规则的有效性,比如验证DTI超40%的群体是否真的逾期率更高
但这种方法不能直接作为审批阶段的高风险分群依据——因为审批时没有逾期数据可用,强行使用会脱离实际业务逻辑,且分群数量过多会导致规则复杂到无法落地执行。
3. 面试作业的平衡策略
如果是面试作业,可以同时展示两种方法,并明确说明各自的适用场景:
- 重点展示无目标变量的分群结果,说明这是符合实际审批流程的可落地方案
- 将纳入逾期标记的分析作为补充,说明这是用于优化规则的辅助手段,最终的高风险分群判定仍以DTI为核心依据
内容的提问来源于stack exchange,提问作者Nandy
相关产品推荐
相关产品推荐

