Python如何实现DataFrame按用户随机抽样并保留选中用户全部行
按用户维度整组抽样实现方案
核心逻辑:先对去重后的用户标识做随机抽样,再通过匹配用户ID过滤原数据集,即可完整保留被抽中用户的所有关联行,不会拆分同一用户的多条数据。
步骤1:构造示例数据集
先复现问题中提到的测试数据:
import pandas as pd # 构建示例DataFrame df = pd.DataFrame({ 'User': ['A', 'A', 'B', 'C', 'D', 'D'], 'Value': [12, 5, 3, 7, 50, 1] })
步骤2:执行按用户维度的抽样
根据实际抽样需求选择对应代码即可:
按固定用户数抽样
比如需要随机抽取2个用户的全量数据:# 提取所有去重的用户ID all_users = df['User'].unique() # 随机抽指定数量的用户,random_state参数用于固定随机结果、方便复现,不需要可删除 sample_users = pd.Series(all_users).sample(n=2, random_state=42) # 过滤原表,保留被抽中用户的所有行 sample_result = df[df['User'].isin(sample_users)]上述代码如果随机抽中用户A、C,返回结果就会包含A的2行数据、C的1行数据,完全符合需求。
按用户比例抽样
如果需要按比例抽取用户(比如抽取总用户数的50%),把sample()方法的n参数替换为frac参数即可:# 抽取50%的用户 sample_users = pd.Series(df['User'].unique()).sample(frac=0.5) sample_result = df[df['User'].isin(sample_users)]
注意:不要直接调用
df.sample()对行做抽样,该方法会随机抽取独立行,会拆分同一用户的多条关联数据,无法满足整用户维度抽样的需求。
内容的提问来源于stack exchange,提问作者Matheus Barreto Alves De Almei
相关产品推荐
相关产品推荐

