如何基于多变量时序数据优化员工流失预测的Logistic Regression模型?
员工流失预测模型优化求助
我是分析领域新手,恳请包涵!我希望构建一个分类模型,基于每日5分制(1最消极,5最积极)的员工调研数据,预测员工是否会流失(attrited)或在职(active)。
数据情况
原始数据按employee_id、月份、问题维度存储平均得分,共约30个问题,每日一题,格式如下:
| 月份 | employee_id | Q1-您对工作的满意度如何? | Q2-您是否会推荐他人来本公司工作? | ...Q30 | 当前员工状态 |
|---|---|---|---|---|---|
| 1 | emp_1 | 3.5 | 3.7 | 4.0 | 在职 |
| 2 | emp_1 | 3.7 | 4.1 | 3.2 | 在职 |
| 1 | emp_2 | 2.3 | 2.8 | 3.6 | 流失 |
| 2 | emp_2 | 1.8 | 2.0 | 3.2 | 流失 |
| 3 | emp_2 | 1.7 | 2.1 | 3.0 | 流失 |
| -- | --- | --- | --- | --- | --- |
| 4 | emp_200 | 4.1 | 4.3 | 0.0 | 在职 |
| 5 | emp_200 | 3.8 | 4.0 | 3.8 | 在职 |
由于员工入职、离职动态变化,其tenure(任职时长)存在差异:部分员工任职久,拥有多个月的得分数据;部分员工任职短,仅1-2个月数据,甚至因提前离职未参与部分问题调研。我同时拥有按天统计的tenure数据。
现有模型问题
此前我在Excel中构建了Logistic Regression模型,采用员工各问题的平均得分(未考虑tenure),将流失标记为1、在职标记为0,每个employee_id对应一行数据,格式如下:
| employee_id | Q1-您对工作的满意度如何? | Q2-您是否会推荐他人来本公司工作? | ...Q30 | 当前员工状态 |
|---|---|---|---|---|
| emp_1 | 3.5 | 3.7 | 4.0 | 0 |
| emp_2 | 2.3 | 2.8 | 3.6 | 1 |
| -- | --- | --- | --- | --- |
| emp_200 | 4.1 | 4.3 | 3.9 | 0 |
| emp_201 | 3.8 | 4.0 | 3.8 | 1 |
该模型在0.3概率阈值下,对流失员工的精准度仅为44%(已剔除数据质量差的员工记录)。此外,数据集存在类别不平衡问题(在职员工占80%,流失员工占20%),虽整体准确率达84%,但流失预测的真阳性率较低(约44%)。
求助方向
现希望通过引入tenure作为特征或开展时序分析来优化模型,且需在Python中实现。我尚未找到匹配的文献或资料,恳请社区提供相关建议与资源。
内容的提问来源于stack exchange,提问作者Ishaan Tiwari
相关产品推荐
相关产品推荐

