使用kproto聚类后,clprofiles生成图形的高度含义咨询
关于clustMixType包中clprofiles绘图高度含义的解答
我正在使用kproto算法进行聚类分析,通过clprofiles函数绘制图形来查看聚类结果,但不清楚该图形中高度的含义,且在帮助文档中未找到相关说明,特向大家咨询。
示例代码如下:
# generate toy data with factors and numerics library(clustMixType) n <- 100 prb <- 0.9 muk <- 1.5 clusid <- rep(1:4, each = n) x1 <- sample(c("A","B"), 2*n, replace = TRUE, prob = c(prb, 1-prb)) x1 <- c(x1, sample(c("A","B"), 2*n, replace = TRUE, prob = c(1-prb, prb))) x1 <- as.factor(x1) x2 <- sample(c("A","B"), 2*n, replace = TRUE, prob = c(prb, 1-prb)) x2 <- c(x2, sample(c("A","B"), 2*n, replace = TRUE, prob = c(1-prb, prb))) x2 <- as.factor(x2) x3 <- c(rnorm(n, mean = -muk), rnorm(n, mean = muk), rnorm(n, mean = -muk), rnorm(n, mean = muk)) x4 <- c(rnorm(n, mean = -muk), rnorm(n, mean = muk), rnorm(n, mean = -muk), rnorm(n, mean = muk)) x <- data.frame(x1,x2,x3,x4) # apply k-prototyps kpres <- kproto(x, 4) clprofiles(kpres, x)
图形高度的具体含义
clprofiles生成的聚类轮廓图里,高度的含义会根据变量类型不同而区分:
- 数值型变量(比如示例中的x3、x4):图中每个聚类对应的高度,就是该聚类在这个数值变量上的均值,和传统聚类的簇中心均值逻辑一致,直观反映该簇样本在这个连续变量上的整体取值水平。
- 分类型变量(比如示例中的x1、x2):高度代表该聚类中对应类别出现的比例(相对频率)。比如示例里前两个聚类(簇1、簇2)的x1变量中"A"的高度接近0.9,就说明这两个簇里有90%的样本x1取值为"A";后两个聚类则是"B"的比例更高,对应图中"B"的高度接近0.9。
你可以结合示例代码里的变量生成逻辑验证:x1前2n个样本是高概率取"A",对应前两个聚类,所以图里这两个簇"A"的高度很高,和代码里的prb=0.9完全对应;数值变量x3的簇1、3均值是-muk,簇2、4是muk,图里的高度也会对应这些数值。
内容的提问来源于stack exchange,提问作者cloudscomputes
相关产品推荐
相关产品推荐

