从flexmix对象进行预测（R）

Question

从flexmix对象进行预测（R）

3

我在flexmix中将一些数据适配到了一个由两个高斯分布混合而成的分布中：

data("NPreg", package = "flexmix")
mod <- flexmix(yn ~ x, data = NPreg, k = 2,
           model = list(FLXMRglm(yn ~ x, family= "gaussian"),
                        FLXMRglm(yn ~ x, family = "gaussian")))

模型拟合如下：

> mod

Call:
flexmix(formula = yn ~ x, data = NPreg, k = 2, model =    list(FLXMRglm(yn ~ x, family = "gaussian"), 
    FLXMRglm(yn ~ x, family = "gaussian")))

Cluster sizes:
  1   2 
 74 126 

convergence after 31 iterations

但是我该如何从这个模型中进行预测呢？

当我执行以下代码时

pred <- predict(mod, NPreg)

我收到了一个包含两个组件预测结果的列表

如果要获取单个预测结果，我需要像这样添加簇的大小吗？

single <- (74/200)* pred$Comp.1[,1] + (126/200)*pred$Comp.2[,2]

- spore234

2个回答

0

你可以向你的预测调用传递一个额外的参数。

pred <- predict(mod, NPreg, aggregate = TRUE)[[1]][,1]

- vivek mishra

网页内容由stack overflow 提供, 点击上面的

可以查看英文原文，
原文链接

- Divi · Accepted Answer

我使用 flexmix 进行以下方式的预测:

pred = predict(mod, NPreg)
clust = clusters(mod,NPreg)
result = cbind(NPreg,data.frame(pred),data.frame(clust))
plot(result$yn,col = c("red","blue")[result$clust],pch = 16,ylab = "yn")

混淆矩阵如下:

table(result$class,result$clust)

为了获得yn的预测值，我选择数据点所属聚类的组成值。

for(i in 1:nrow(result)){
  result$pred_model1[i] = result[,paste0("Comp.",result$clust[i],".1")][i]
  result$pred_model2[i] = result[,paste0("Comp.",result$clust[i],".2")][i]
}

实际结果与预测结果显示拟合度良好（这里只添加一个，因为你的两个模型是相同的，你将使用pred_model2来表示第二个模型）。

qplot(result$yn, result$pred_model1,xlab="Actual",ylab="Predicted") + geom_abline()

RMSE = sqrt(mean((result$yn-result$pred_model1)^2))

给出了均方根误差为5.54。

这个答案基于我在使用flexmix时阅读的许多SO答案。它对我的问题很有效。

您可能还有兴趣将两个分布可视化。我的模型如下，显示了一些重叠，因为组件比例不接近1。

Call:
flexmix(formula = yn ~ x, data = NPreg, k = 2, 
model = list(FLXMRglm(yn ~ x, family = "gaussian"), 
             FLXMRglm(yn ~ x, family = "gaussian")))

       prior size post>0 ratio
Comp.1 0.481  102    129 0.791
Comp.2 0.519   98    171 0.573

'log Lik.' -1312.127 (df=13)
AIC: 2650.255   BIC: 2693.133

我还使用直方图生成密度分布来可视化两个组件。这得益于betareg维护者在SO上的一个答案的启发。

a = subset(result, clust == 1)
b = subset(result, clust == 2)
hist(a$yn, col = hcl(0, 50, 80), main = "",xlab = "", freq = FALSE, ylim = c(0,0.06))
hist(b$yn, col = hcl(240, 50, 80), add = TRUE,main = "", xlab = "", freq = FALSE, ylim = c(0,0.06))
ys = seq(0, 50, by = 0.1)
lines(ys, dnorm(ys, mean = mean(a$yn), sd = sd(a$yn)), col = hcl(0, 80, 50), lwd = 2)
lines(ys, dnorm(ys, mean = mean(b$yn), sd = sd(b$yn)), col = hcl(240, 80, 50), lwd = 2)

# Joint Histogram
p <- prior(mod)
hist(result$yn, freq = FALSE,main = "", xlab = "",ylim = c(0,0.06))
lines(ys, p[1] * dnorm(ys, mean = mean(a$yn), sd = sd(a$yn)) +
        p[2] * dnorm(ys, mean = mean(b$yn), sd = sd(b$yn)))