如何借助sumd与idx选取WCSS最高簇实现bisecting k-means聚类
Matlab实现二分K-Means最高WCSS簇选取与迭代拆分
二分K-Means的迭代拆分核心逻辑就是每次从现有簇中选出WCSS(簇内平方和)最高的簇拆分为2个子簇,直到簇总数达到预设值,kmeans返回的sumd值正好对应每个簇的WCSS,可以直接用来做选取依据。
你现有代码的问题是第一次二分后没有单独维护每个簇的独立信息,只保留了全局的索引、质心、距离和结果,无法直接定位待拆分的簇,按以下步骤补全逻辑即可:
- 第一次二分完成后,初始化簇列表,为每个簇单独存储四类信息:簇对应的原始用户ID、簇内样本特征、簇质心、簇WCSS值
- 每轮迭代先遍历所有现有簇,找到WCSS值最大的簇作为待拆分对象
- 仅对待拆分的簇内样本运行k=2的kmeans,得到两个子簇的对应结果
- 从簇列表中移除被拆分的原簇,将拆分得到的两个新子簇加入簇列表
- 重复上述流程直到簇总数达到当前波束下的目标簇数
注意你原代码里循环条件有笔误:SYSTEM.Ncluster(ii)应为SYSTEM.Nclusters(ii),补全后的完整代码如下:
function [Clustering, SYSTEM] = CLUST_Bkmeans(kk, SYSTEM, USERS, ChannelMatrix) Clustering = cell(SYSTEM.Nbeams,1); UserPool = (1:SYSTEM.Nusers)'; Channel_real = real(ChannelMatrix); Channel_imag = imag(ChannelMatrix); avg_clusterSize = kk; for ii=1:SYSTEM.Nbeams Users = UserPool(USERS.BeamIndex==ii); % 构建[实部 | 虚部]形式的信道系数矩阵 Users_real = Channel_real(Users,:); Users_imag = Channel_imag(Users,:); X = [Users_real Users_imag]; SYSTEM.Nclusters(ii) = ceil(size(Users,1)/avg_clusterSize); Clustering{ii} = cell(SYSTEM.Nclusters(ii),1); % 处理当前波束下用户数不足2的边界情况 if size(Users,1) < 2 Clustering{ii}{1} = Users'; continue end % 首次二拆分 [idx,C,sumd] = kmeans(X,2); % 初始化簇存储结构 cluster_list = struct('user_ids', {}, 'samples', {}, 'centroid', {}, 'wcss', {}); for c = 1:2 cluster_list(c).user_ids = Users(idx==c); cluster_list(c).samples = X(idx==c, :); cluster_list(c).centroid = C(c, :); cluster_list(c).wcss = sumd(c); end for pp = 3:SYSTEM.Nclusters(ii) % 定位WCSS最高的簇 [~, split_pos] = max(arrayfun(@(cl) cl.wcss, cluster_list)); target_cl = cluster_list(split_pos); % 对待拆分簇做k=2聚类,加'Replicates'参数多次运行避免局部最优 [sub_idx, sub_C, sub_sumd] = kmeans(target_cl.samples, 2, 'Replicates', 3); % 生成两个新子簇 new_cl1 = struct(... 'user_ids', target_cl.user_ids(sub_idx==1), ... 'samples', target_cl.samples(sub_idx==1, :), ... 'centroid', sub_C(1,:), ... 'wcss', sub_sumd(1) ... ); new_cl2 = struct(... 'user_ids', target_cl.user_ids(sub_idx==2), ... 'samples', target_cl.samples(sub_idx==2, :), ... 'centroid', sub_C(2,:), ... 'wcss', sub_sumd(2) ... ); % 用两个子簇替换原待拆分簇 cluster_list(split_pos) = []; cluster_list(end+1) = new_cl1; cluster_list(end+1) = new_cl2; end % 填充最终聚类结果 for jj = 1:SYSTEM.Nclusters(ii) Clustering{ii}{jj,1} = cluster_list(jj).user_ids'; end end end
补充说明:调用kmeans时加'Replicates',n参数,可对每次拆分重复跑n次kmeans取总WCSS最小的结果,能有效降低随机初始化带来的局部最优问题。如果需要固定聚类结果可在函数开头加rng(固定种子值)保证结果可复现。
内容的提问来源于stack exchange,提问作者Emanuele Gandolfi
相关产品推荐
相关产品推荐

