You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

pandas如何实现行内嵌套数据的类unstack行转列操作

实现方案

核心逻辑是先补充分组关联字段,拆分零件编号与作业内容两类数据,再重组为目标宽表,无需依赖多层索引的unstack方法。

步骤1:预处理数据补全分组标识

初始数据中ref列仅每组首行有有效值,先将字符串格式的空值替换为pandas可识别的缺失值,再通过向前填充给同组所有行匹配正确的ref编号:

import pandas as pd

# 加载初始DataFrame
df_initial = pd.DataFrame(data = {
    'ref':['02','NaN','NaN','NaN','03','NaN','NaN','NaN'], 
    'Part_ID':['1234-1', 'Shop_Work','repair','scrap','4567-2','Shop_Work','clean','overhaul']
})

# 替换字符串空值+向前填充ref列
df = df_initial.replace('NaN', pd.NA)
df['ref'] = df['ref'].ffill()

注意:如果不先把字符串'NaN'替换为真实缺失值,向前填充逻辑无法正常生效。

步骤2:区分组内数据类型

每个ref分组下,第一行存储零件编号,后续行存储对应作业内容,通过组内计数标记每行的类型:

# 生成每个ref分组内的行序号
df['row_rank'] = df.groupby('ref').cumcount()

# 拆分出零件编号数据(组内序号为0的行)
df_part = df[df['row_rank'] == 0][['ref', 'Part_ID']]

# 拆分出作业内容数据,按顺序生成后续要转成列的字段名
df_operation = df[df['row_rank'] > 0].copy()
df_operation['col_name'] = 'operation_' + df_operation['row_rank'].astype(str)

步骤3:重组为目标宽表

将行存储的作业内容透视为列,再和零件编号表合并即可得到最终结果:

# 作业内容行转列
df_op_pivot = df_operation.pivot(index='ref', columns='col_name', values='Part_ID').reset_index()

# 合并得到最终结构化表
df_result = df_part.merge(df_op_pivot, on='ref')

最终输出的df_result结构完全匹配目标要求:

refPart_IDoperation_1operation_2operation_3
021234-1Shop_Workrepairscrap
034567-2Shop_Workcleanoverhaul

如果后续每个分组下的作业数量不固定,这套逻辑也可以自动适配,不需要手动调整列的数量。

内容的提问来源于stack exchange,提问作者Prolle

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.08 16:15:17