You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Julia:从分组DataFrame中随机抽取N组的更简洁实现问询

更紧凑的分组随机抽取方案

你的现有思路能实现需求,但确实可以简化——我们不需要给每个组加随机数再排序排名,直接针对分组标识做抽样再过滤原数据就好,逻辑更直观,代码也更短。

方法一:直接抽样分组标识后过滤(最简洁)

先提取所有唯一的商品ID,随机选N个,再筛选原DataFrame中属于这些ID的行:

using DataFrames, StatsBase, Pipe

# 你的示例数据
df = DataFrame(
    time = [0, 1, 0, 1, 0, 1],
    amt = [19.00, 11.00, 35.50, 32.50, 5.99, 5.99],
    item = ["B001", "B001", "B020", "B020", "BX00", "BX00"]
)

# 设定要抽取的组数
N = 2

# 一行完成抽样+过滤
sampled_df = @pipe df |> filter(:item => x -> x ∈ sample(unique(df.item), N; replace=false), _)

运行后就能得到随机抽取的2组数据,和你原来的结果一致,但步骤少了很多。

方法二:分组后抽样组(适合保留分组结构)

如果后续还要对分组做操作,可以先分组,再随机选择N个分组合并:

gdf = groupby(df, :item)
sampled_df = combine(gdf[sample(1:length(gdf), N; replace=false)], :)

这个方法直接对分组对象的索引抽样,再合并选中的组,同样很简洁。

为什么这两种方法更好?

  • 避免了添加随机列、排序、排名这些冗余操作,代码更易读
  • 性能更优:尤其是数据量大的时候,不需要处理额外的中间列和分组转换
  • 逻辑更直接:核心就是"选N个组,拿这些组的所有数据",符合直觉

内容的提问来源于stack exchange,提问作者Merlin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.09 19:07:50