Pandas如何从上下级映射DataFrame中递归获取完整树形层级结构
树形层级提取实现方案
核心逻辑
你之前查找根节点的逻辑是正确的,问题出在后续层级匹配的写法混乱,不需要反复对DataFrame做切片、临时赋值操作,按下面的逻辑写即可:
- 提前把「上级节点 -> 所有直属下级节点」的映射关系构建为字典,查询效率远高于每次遍历DataFrame做筛选,数据量越大优势越明显
- 用队列做广度优先遍历(BFS),初始将根节点放入队列,每次弹出一个节点查询其所有直属下级,记录上下级关系后,将下级节点放回队列作为新的上级节点继续查询,直到队列为空就完成整棵树的遍历
- 如果需要嵌套的JSON式树形结构,基于预构建的映射字典写递归函数即可,逻辑非常简洁
可直接运行的代码
import pandas as pd from collections import deque # 替换成你自己的读文件逻辑即可,这里用你给出的示例数据做测试 # df1 = pd.read_excel(r'path').fillna("@Null$tring").sort_values(by=['VP']) df1 = pd.DataFrame({ 'SP': ['--', 'king', 'king', 'knight 1'], 'VP': ['king', 'knight 1', 'knight 2', 'knight 3'] }) # 1. 提取根节点(SP列存在、VP列不存在的节点) root = pd.Index(df1["SP"]).difference(pd.Index(df1["VP"])).tolist()[0] # 2. 预构建上下级映射字典 child_map = df1.groupby('SP')['VP'].apply(list).to_dict() # 映射字典结构示例:{'--': ['king'], 'king': ['knight 1', 'knight 2'], 'knight 1': ['knight 3']} # 3. 广度优先遍历整棵树,收集完整层级关系 tree_relations = [] q = deque([root]) while q: current_node = q.popleft() # 查询当前节点的所有直属下级,无下级则返回空列表 children = child_map.get(current_node, []) for child in children: tree_relations.append( (current_node, child) ) q.append(child) # 转换为DataFrame格式的完整层级表 full_hierarchy = pd.DataFrame(tree_relations, columns=['上级节点', '直属下级节点']) print(full_hierarchy)
运行结果
执行代码后输出的扁平层级关系表如下:
上级节点 直属下级节点 0 king knight 1 1 king knight 2 2 knight 1 knight 3
你原有代码的问题
- 定义了大量无实际用途的中间变量(VP2、root2、sps、spss等),把遍历逻辑绕得过于混乱
df3 = df2['VP'].isin(df1['SP'])仅返回布尔值序列,没有做实际的行筛选,拿不到有效数据df3 = df1.loc['SP'] = [df2['VP']]属于错误的赋值操作,会直接修改原DataFrame的结构,完全不是查询逻辑
如果需要输出嵌套的树形结构,可以基于已经构建好的child_map用递归快速实现:
def build_nested_tree(node): return { "节点名称": node, "下级节点": [build_nested_tree(child) for child in child_map.get(node, [])] } nested_tree = build_nested_tree(root)
内容的提问来源于stack exchange,提问作者Anthony Admin
相关产品推荐
相关产品推荐

