如何控制KMedoids计算方法的CPU核心使用数量?
KMedoids并行优化问题解答
多进程库核心控制的理解
你的理解完全正确。joblib、multiprocessing这类工具仅负责管理并行进程的数量,无法直接干预单个进程内部的CPU核心使用率——这取决于进程内运行的代码本身是否实现了多线程/多核心并行逻辑。由于sklearn_extra.cluster.KMedoids本身没有多线程支持,单个_compute_medoids进程只会占用1个核心。
进程绑定核心的可行性
你提出的“16核分配为4个工作进程,每个进程绑定4个核心”的方案是可行的,可以通过跨平台的psutil库或系统原生的os.sched_setaffinity实现单个进程的CPU核心绑定。
具体实现代码
修改_compute_medoids函数,在执行聚类前为当前进程绑定指定核心组:
from sklearn_extra.clusters import KMedoids import psutil def _compute_medoids(df, k, core_group): # 获取当前进程并设置核心亲和性 current_proc = psutil.Process() current_proc.cpu_affinity(core_group) k_medoids = KMedoids(n_clusters=k, metric='precomputed', init='k-medoids++').fit(df) return k_medoids.medoid_indices_, k_medoids.labels_
然后按核心分组启动并行进程:
from joblib import Parallel, delayed # 假设系统总核心数16,分成4组每组4个核心 core_groups = [ [0,1,2,3], [4,5,6,7], [8,9,10,11], [12,13,14,15] ] # 启动4个并行进程,每个进程对应一个核心组 results = Parallel(n_jobs=4)( delayed(_compute_medoids)(df, k, core_groups[k%4]) for k in range(1, 6) )
关键注意点
- 核心绑定仅能限制进程使用指定核心,无法让单线程的KMedoids自动利用多核心:因为KMedoids本身的计算逻辑是单线程的,绑定多个核心不会提升单个进程的计算速度,只是避免进程抢占其他进程的核心资源。
- 核心分组必须无重叠,否则会导致不同进程竞争同一核心,反而降低性能。
- 如果要真正让KMedoids计算利用多核心,需要修改
sklearn_extra的源码实现多线程距离计算,或使用支持多线程的替代库(如基于faiss的聚类实现)。
额外优化方向
- 缩小k值测试范围,优先验证业务场景下合理的k值区间,减少不必要的计算。
- 对输入数据
df进行降维处理(如PCA、TSNE),降低距离计算的复杂度。 - 调整
KMedoids的max_iter参数,减少迭代次数(需权衡聚类效果与速度)。
内容的提问来源于stack exchange,提问作者Rafael Higa
相关产品推荐
相关产品推荐

