You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何偏移Numpy数组中的聚类样本值以实现聚类更分离?

让Scikit-learn make_blobs生成的聚类更分离的正确方法

要让3个2维聚类更分离,核心是拉大每个聚类整体中心的间距,以下两种方法直接有效:

方法一:生成数据时直接设置远距离聚类中心

不用事后调整,直接在make_blobs中手动指定间距足够大的聚类中心,这是最省心的方式:

from sklearn.datasets import make_blobs
import matplotlib.pyplot as plt

# 手动设置距离较远的3个中心,比如两两间距超过20
X, y = make_blobs(
    n_samples=300,
    centers=[[18, 18], [-18, -18], [18, -18]],  # 自定义远中心
    n_features=2,
    cluster_std=1,  # 控制聚类内样本的分散程度,值越小聚类越紧凑
    random_state=42
)

# 可视化
plt.scatter(X[:, 0], X[:, 1], c=y, cmap='viridis')
plt.show()

方法二:生成数据后按标签整体偏移聚类

如果已经生成了基础数据,直接用聚类标签y筛选样本,给每个聚类加固定偏移量(而非随机值),确保整个聚类整体移动:

# 先生成基础聚类数据
X_base, y_base = make_blobs(n_samples=300, centers=3, n_features=2, random_state=42)

# 给每个聚类分配不同的偏移量,按需调整数值大小
offsets = {
    0: [10, 10],   # 第0类向右上偏移
    1: [-10, -10], # 第1类向左下偏移
    2: [10, -10]   # 第2类向右下偏移
}

# 执行偏移
X_shifted = X_base.copy()
for label in offsets:
    X_shifted[y_base == label] += offsets[label]

# 对比可视化
fig, (ax1, ax2) = plt.subplots(1, 2, figsize=(12, 5))
ax1.scatter(X_base[:, 0], X_base[:, 1], c=y_base, cmap='viridis')
ax1.set_title('原始聚类')
ax2.scatter(X_shifted[:, 0], X_shifted[:, 1], c=y_base, cmap='viridis')
ax2.set_title('偏移后聚类')
plt.show()

你之前方法失效的原因

  • 用坐标范围筛选样本:聚类可能存在重叠,坐标筛选容易误选其他聚类的样本,导致偏移混乱
  • 添加正态分布随机值:这是给样本加噪声,会让聚类内部更分散,反而可能拉近聚类间距,不是整体偏移的正确方式

内容的提问来源于stack exchange,提问作者Shayan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.14 14:56:27