You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas将组级DataFrame转为个人级并设置登顶标识列的问题

问题描述

现有一个Pandas DataFrame,每行代表一支登山队伍,包含Attempted(队伍规模)和Succeeded(登顶成功人数)列:

d = {'Attempted': [11, 12, 2, 5], 'Succeeded': [0, 6, 2, 3]}
df = pd.DataFrame(data=d)
df

需要将该DataFrame转换为每行代表单个登山者的形式,并新增一列Summit表示该登山者是否登顶(1表示登顶,0表示未登顶)。具体要求是:针对每支队伍,根据Attempted的数值复制对应行数,其中Succeeded数量的行设为1,剩余(Attempted - Succeeded)数量的行设为0。例如第二行队伍,12条新行中6条Summit为0,6条为1。

目前已实现行复制并将新增列设为1,但不知道如何根据未登顶人数将部分1替换为0:

df_new = df.loc[df.index.repeat(df["Attempted"])].assign(ind_summit =  1).reset_index(drop = True)
解决方案

可以通过分组标记的方式实现需求,以下是两种简洁的实现方式:

方法一:直接生成对应数量的0和1

先扩展行并保留原队伍的索引,再按原索引分组生成Summit列:

import pandas as pd

d = {'Attempted': [11, 12, 2, 5], 'Succeeded': [0, 6, 2, 3]}
df = pd.DataFrame(data=d)

# 扩展行并保留原队伍的索引
df_expanded = df.loc[df.index.repeat(df["Attempted"])].reset_index(level=0)

# 分组生成0和1的序列:先填未登顶的0,再填登顶的1
df_expanded['Summit'] = df_expanded.groupby('index').apply(
    lambda x: [0]*(x['Attempted'].iloc[0] - x['Succeeded'].iloc[0]) + [1]*x['Succeeded'].iloc[0]
).explode().astype(int)

# 清理临时列并重置索引
df_final = df_expanded.drop('index', axis=1).reset_index(drop=True)

方法二:利用分组累计计数判断

通过组内累计计数,判断当前行是否属于登顶人群:

import pandas as pd

d = {'Attempted': [11, 12, 2, 5], 'Succeeded': [0, 6, 2, 3]}
df = pd.DataFrame(data=d)

# 扩展行并保留原队伍索引
df_new = df.loc[df.index.repeat(df["Attempted"])].reset_index(level=0)

# 组内从0开始计数,当计数≥未登顶人数时标记为1
df_new['Summit'] = df_new.groupby('index').cumcount() >= (df_new['Attempted'] - df_new['Succeeded'])
df_new['Summit'] = df_new['Summit'].astype(int)

# 清理临时列并重置索引
df_final = df_new.drop('index', axis=1).reset_index(drop=True)

内容的提问来源于stack exchange,提问作者set_user123

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.06 23:40:30