You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于权重重采样Numpy数组:按行大小调整重复次数

解决方法

核心思路

由于原数组各列数值尺度差异大,没法直接用某列数值判断行的大小。所以先把所有列的数值统一到同一尺度,再给每行分配重复次数——行的“相对大小”越小,重复次数越多,最终凑够500行。

具体步骤

  1. 归一化处理,统一列尺度
    先对原数组的每一列做min-max归一化,把每列数值缩放到0-1区间,让不同列的数值具备可比性。之后用每行的均值(或总和)来代表该行的“相对大小”,均值越小,代表行的整体数值越小。

  2. 计算每行的重复次数
    基于归一化后的行大小,生成与行大小成反比的权重(行越小,权重越大),再按权重比例分配500次重复名额。最后对次数做取整微调,确保总重复次数刚好是500。

  3. 按重复次数扩展数组
    用numpy的repeat函数,根据计算好的重复次数对每行进行重复,得到最终的500×4数组。

代码实现

import numpy as np

# 模拟输入的50×4数组(行从低值到高值排列)
np.random.seed(42)
arr = np.zeros((50, 4))
for i in range(50):
    arr[i] = [i*10, i*200, i*10000, i*3]

# 步骤1:归一化列数据,计算行的相对大小
# 对每列做min-max归一化
norm_arr = (arr - arr.min(axis=0)) / (arr.max(axis=0) - arr.min(axis=0))
# 用每行均值作为行大小的判断依据
row_sizes = norm_arr.mean(axis=1)

# 步骤2:计算重复次数,确保总次数为500
# 生成反比权重,加1e-8避免除以0
weights = 1 / (row_sizes + 1e-8)
# 按权重比例分配次数并取整
repeat_counts = np.round((weights / weights.sum()) * 500).astype(int)
# 微调次数,保证总和刚好是500
diff = 500 - repeat_counts.sum()
if diff > 0:
    # 给权重最大的前diff行各加1次
    top_indices = np.argsort(weights)[-diff:]
    repeat_counts[top_indices] += 1
elif diff < 0:
    # 给权重最小的前abs(diff)行各减1次
    bottom_indices = np.argsort(weights)[:abs(diff)]
    repeat_counts[bottom_indices] -= 1

# 步骤3:扩展数组
expanded_arr = np.repeat(arr, repeat_counts, axis=0)

# 验证结果
print(expanded_arr.shape)  # 输出 (500, 4)

补充说明

  • 归一化方法也可以换成z-score归一化,根据你的数据分布选择即可;
  • 用行总和代替行均值判断行大小,效果类似,可根据需求调整;
  • 重复次数的微调步骤是必须的,避免取整导致总次数偏离500。

内容的提问来源于stack exchange,提问作者helloworld

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.13 10:20:39