You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从Pandas DataFrame按长尾分布采样并解决权重匹配错误

错误原因与解决方法

错误根源

你遇到的ValueError是因为prob的长度是1000(对应1000个不同的sample类别),但df.sample()要求weights的长度必须和DataFrame的总行数完全一致(也就是所有数据的总和,比如750+746+…+1),两者长度不匹配导致报错。


正确实现方法

方法一:按原长尾比例采样

如果只是想保持原有的长尾分布比例,按比例缩小总样本量,给每一行分配对应类别的权重即可:

import pandas as pd

# 将类别频数转成字典,方便给每行映射权重
freq_dict = df['a'].value_counts().to_dict()
# 给每行分配对应类别的频数作为权重(也可以用归一化后的概率,效果一致)
df['weights'] = df['a'].map(freq_dict)

# 假设你要按sample4从652缩到400的比例,计算总采样量
scale_factor = 400 / 652
target_total = int(df.shape[0] * scale_factor)

# 执行无放回采样,权重对应每行的类别频数
df_sampled = df.sample(n=target_total, replace=False, weights='weights')

# 验证采样后的频数分布
print(df_sampled['a'].value_counts())

方法二:精确控制目标频数采样

如果需要严格指定每个类别的目标频数(比如sample4必须是400),可以用分层采样的方式:

import pandas as pd

# 计算缩放因子(以sample4的目标频数为准)
scale_factor = 400 / 652
# 生成每个类别的目标频数字典
target_freq = {
    sample: int(cnt * scale_factor)
    for sample, cnt in df['a'].value_counts().items()
}

# 分层采样每个类别到目标数量
df_sampled = pd.concat([
    df[df['a'] == sample].sample(n=target_freq[sample], replace=False)
    for sample in target_freq
])

# 打乱采样结果的顺序并重置索引
df_sampled = df_sampled.sample(frac=1).reset_index(drop=True)

# 验证结果
print(df_sampled['a'].value_counts())

方法说明

  • 方法一适合快速保持原分布比例的采样,代码简洁,适合不需要精确控制单类别数量的场景。
  • 方法二可以精确控制每个类别的样本量,严格维持你需要的长尾形态,适合有明确目标频数要求的场景。

内容的提问来源于stack exchange,提问作者HumanTorch

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.06 21:55:09