使用Python Pandas生成员工至最高管理层的完整层级路径
使用Python Pandas生成员工至最高管理层的完整层级路径
嗨,我来帮你搞定这个员工层级路径生成的问题!先理清楚你的需求:我们要给每个员工生成一条从最高管理层(level 0)到他自己的完整路径,用|拼接沿途的path_variable,还要避开iterrows()这种效率较低的方法对吧?
先复现你的原始数据
首先先把你提供的DataFrame构造代码放出来,方便后续操作:
import pandas as pd data=[['1','0','0','0','0'],['2','1','1','0','0|0'],['3','1','1','1','0|1'],['4','2','2','0','0|0|0'],['5','2','2','1','0|0|1'],['6','2','2','2','0|0|2'],['7','3','2','0','0|1|0'],['8','3','2','1','0|1|1'],['9','3','2','2','0|1|2'],['10','3','2','3','0|1|3'],['11','4','3','0','0|0|0|0'],['12','4','3','1','0|0|0|1'],['13','10','3','0','0|1|3|0']] df = pd.DataFrame(data, columns=['eid','m_eid','level','path_variable','complete_path']) df=df.drop('complete_path',axis=1)
解决方案思路
因为这是一个树形的层级结构,我们需要从每个员工向上追溯到根节点(level 0,也就是m_eid为0的员工),然后把沿途的path_variable按顺序拼接。为了提升效率,我们可以:
- 先构建一个快速查找的映射字典,把每个员工的经理ID和对应路径变量存起来
- 用带缓存的递归函数来生成路径——缓存可以避免重复计算相同上级的路径,大幅提升性能
- 用
apply方法批量生成路径,比iterrows()高效得多
具体实现代码
from functools import lru_cache # 第一步:构建员工到经理ID、路径变量的映射字典,方便快速查找 employee_map = df.set_index('eid')[['m_eid', 'path_variable']].to_dict('index') # 第二步:定义带缓存的路径生成函数 @lru_cache(maxsize=None) def get_complete_path(eid): current_info = employee_map[eid] current_path_var = current_info['path_variable'] manager_eid = current_info['m_eid'] # 如果是最高层管理者(经理ID为0),直接返回自身的路径变量 if manager_eid == '0': return current_path_var # 否则先获取经理的完整路径,再拼接当前员工的路径变量 else: manager_full_path = get_complete_path(manager_eid) return f"{manager_full_path}|{current_path_var}" # 第三步:给DataFrame添加完整路径列 df['complete_path'] = df['eid'].apply(get_complete_path)
验证结果
运行完上面的代码后,你就能得到想要的complete_path列了。比如:
- eid=10的完整路径是
0|1|3,和你给出的例子完全一致 - eid=13的完整路径是
0|1|3|0,完美匹配需求 - 即使存在层级跳跃的情况,这个方法也能正确追溯到根节点,因为我们是通过
m_eid而非level来向上查找的
这个方法的优势在于:lru_cache会缓存已经计算过的路径,比如同一个经理的所有下属,只会计算一次经理的路径;而且apply是向量化操作,比逐行迭代的iterrows()效率高很多,适合处理大规模数据。
备注:内容来源于stack exchange,提问作者Akshit Chauhan
相关产品推荐
相关产品推荐

