You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python如何实现DataFrame按用户随机抽样并保留选中用户全部行

按用户维度整组抽样实现方案

核心逻辑:先对去重后的用户标识做随机抽样,再通过匹配用户ID过滤原数据集,即可完整保留被抽中用户的所有关联行,不会拆分同一用户的多条数据。


步骤1:构造示例数据集

先复现问题中提到的测试数据:

import pandas as pd

# 构建示例DataFrame
df = pd.DataFrame({
    'User': ['A', 'A', 'B', 'C', 'D', 'D'],
    'Value': [12, 5, 3, 7, 50, 1]
})

步骤2:执行按用户维度的抽样

根据实际抽样需求选择对应代码即可:

  • 按固定用户数抽样
    比如需要随机抽取2个用户的全量数据:

    # 提取所有去重的用户ID
    all_users = df['User'].unique()
    # 随机抽指定数量的用户,random_state参数用于固定随机结果、方便复现,不需要可删除
    sample_users = pd.Series(all_users).sample(n=2, random_state=42)
    
    # 过滤原表,保留被抽中用户的所有行
    sample_result = df[df['User'].isin(sample_users)]
    

    上述代码如果随机抽中用户A、C,返回结果就会包含A的2行数据、C的1行数据,完全符合需求。

  • 按用户比例抽样
    如果需要按比例抽取用户(比如抽取总用户数的50%),把sample()方法的n参数替换为frac参数即可:

    # 抽取50%的用户
    sample_users = pd.Series(df['User'].unique()).sample(frac=0.5)
    sample_result = df[df['User'].isin(sample_users)]
    

注意:不要直接调用df.sample()对行做抽样,该方法会随机抽取独立行,会拆分同一用户的多条关联数据,无法满足整用户维度抽样的需求。


内容的提问来源于stack exchange,提问作者Matheus Barreto Alves De Almei

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.01 20:54:35