You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何借助sumd与idx选取WCSS最高簇实现bisecting k-means聚类

Matlab实现二分K-Means最高WCSS簇选取与迭代拆分

二分K-Means的迭代拆分核心逻辑就是每次从现有簇中选出WCSS(簇内平方和)最高的簇拆分为2个子簇,直到簇总数达到预设值,kmeans返回的sumd值正好对应每个簇的WCSS,可以直接用来做选取依据。

你现有代码的问题是第一次二分后没有单独维护每个簇的独立信息,只保留了全局的索引、质心、距离和结果,无法直接定位待拆分的簇,按以下步骤补全逻辑即可:

  • 第一次二分完成后,初始化簇列表,为每个簇单独存储四类信息:簇对应的原始用户ID、簇内样本特征、簇质心、簇WCSS值
  • 每轮迭代先遍历所有现有簇,找到WCSS值最大的簇作为待拆分对象
  • 仅对待拆分的簇内样本运行k=2的kmeans,得到两个子簇的对应结果
  • 从簇列表中移除被拆分的原簇,将拆分得到的两个新子簇加入簇列表
  • 重复上述流程直到簇总数达到当前波束下的目标簇数

注意你原代码里循环条件有笔误:SYSTEM.Ncluster(ii)应为SYSTEM.Nclusters(ii),补全后的完整代码如下:

function [Clustering, SYSTEM] = CLUST_Bkmeans(kk, SYSTEM, USERS, ChannelMatrix)
    Clustering = cell(SYSTEM.Nbeams,1);
    UserPool = (1:SYSTEM.Nusers)';
    
    Channel_real = real(ChannelMatrix);
    Channel_imag = imag(ChannelMatrix);
    
    avg_clusterSize = kk;
    
    for ii=1:SYSTEM.Nbeams              
        Users          = UserPool(USERS.BeamIndex==ii);

        % 构建[实部 | 虚部]形式的信道系数矩阵
        Users_real = Channel_real(Users,:);
        Users_imag = Channel_imag(Users,:);
        
        X = [Users_real Users_imag];
        
        SYSTEM.Nclusters(ii) = ceil(size(Users,1)/avg_clusterSize);
        Clustering{ii} = cell(SYSTEM.Nclusters(ii),1);
        
        % 处理当前波束下用户数不足2的边界情况
        if size(Users,1) < 2
            Clustering{ii}{1} = Users';
            continue
        end
        
        % 首次二拆分
        [idx,C,sumd] = kmeans(X,2);
    
        % 初始化簇存储结构
        cluster_list = struct('user_ids', {}, 'samples', {}, 'centroid', {}, 'wcss', {});
        for c = 1:2
            cluster_list(c).user_ids = Users(idx==c);
            cluster_list(c).samples = X(idx==c, :);
            cluster_list(c).centroid = C(c, :);
            cluster_list(c).wcss = sumd(c);
        end

        for pp = 3:SYSTEM.Nclusters(ii)                             
            % 定位WCSS最高的簇
            [~, split_pos] = max(arrayfun(@(cl) cl.wcss, cluster_list));
            target_cl = cluster_list(split_pos);

            % 对待拆分簇做k=2聚类,加'Replicates'参数多次运行避免局部最优
            [sub_idx, sub_C, sub_sumd] = kmeans(target_cl.samples, 2, 'Replicates', 3);

            % 生成两个新子簇
            new_cl1 = struct(...
                'user_ids', target_cl.user_ids(sub_idx==1), ...
                'samples', target_cl.samples(sub_idx==1, :), ...
                'centroid', sub_C(1,:), ...
                'wcss', sub_sumd(1) ...
            );
            new_cl2 = struct(...
                'user_ids', target_cl.user_ids(sub_idx==2), ...
                'samples', target_cl.samples(sub_idx==2, :), ...
                'centroid', sub_C(2,:), ...
                'wcss', sub_sumd(2) ...
            );

            % 用两个子簇替换原待拆分簇
            cluster_list(split_pos) = [];
            cluster_list(end+1) = new_cl1;
            cluster_list(end+1) = new_cl2;
        end
        
        % 填充最终聚类结果
        for jj = 1:SYSTEM.Nclusters(ii)
            Clustering{ii}{jj,1} = cluster_list(jj).user_ids';
        end    
    end
end

补充说明:调用kmeans时加'Replicates',n参数,可对每次拆分重复跑n次kmeans取总WCSS最小的结果,能有效降低随机初始化带来的局部最优问题。如果需要固定聚类结果可在函数开头加rng(固定种子值)保证结果可复现。


内容的提问来源于stack exchange,提问作者Emanuele Gandolfi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.01 14:31:00