根据数据子集的汇总统计信息重新排序因子

Question

根据数据子集的汇总统计信息重新排序因子

3

我将尝试使用forcats::fct_reorder()函数来重新排列数据框的一个子集中的因子，该子集由另一个因子定义。

考虑以下数据框df:

set.seed(12)
df <- data.frame(fct1 = as.factor(rep(c("A", "B", 'C'), each = 200)),
             fct2 = as.factor(rep(c("j", "k"), each = 100)), 
             val = c(rnorm(100, 2), # A - j
                     rnorm(100, 1), # A - k
                     rnorm(100, 1), # B - j
                     rnorm(100, 6), # B - k
                     rnorm(100, 8), # C - j
                     rnorm(100, 4)))# C - k

我想使用ggridges包绘制分面组密度图。例如：

ggplot(data = df, aes(y = fct2, x = val)) +
    stat_density_ridges(geom = "density_ridges_gradient",
                        calc_ecdf = T, 
                        quantile_fun = median, 
                        quantile_lines = T) +
    facet_wrap(~fct1, ncol = 1)

我现在想按每个分面中上密度值的中位数（在fct_reorder()中默认）来订购fct1，即fct2 ==“k”的地方。因此，在这个例子中的目标是出现的分面顺序为B-C-A。这似乎与这里的问题非常相似，不同之处在于我不想先对数据进行汇总，因为我需要原始数据来绘制密度图。我试图改编链接问题答案中的代码：

df <- df %>% mutate(fct1 = forcats::fct_reorder(fct1, filter(., fct2 == 'k') %>% pull(val)))

但是它返回以下错误：

在 forcats::fct_reorder(fct1, filter(., fct2 == "k") %>% pull(val)) 中出现错误:

length(f) == length(.x) 不为 TRUE

很明显它们的长度不同，但我不太明白为什么这个错误是必要的。我猜测通常不能保证所有 fct1 的水平都存在于子集中，这肯定会有问题。然而，在我的例子中并非如此。是否有一种方法可以解决这个错误或者我更普遍地做错了什么？

我知道我可以用几行额外的代码来解决这个问题，例如创建一个辅助变量的子集数据，重新排序它，然后将级别顺序带到原始数据集中的因子。我仍然希望有一个更漂亮的解决方案，因为我经常面临这个非常相同的任务。

- PRZ

1个回答

网页内容由stack overflow 提供, 点击上面的

可以查看英文原文，
原文链接

- Allan Cameron · Accepted Answer

你可以用一个小助手函数来实现这个：

f <- function(i) -median(df$val[df$fct2 == "k" & df$fct1 == df$fct1[i]])

这使您可以像这样重新排序：

df$fct1 <- forcats::fct_reorder(df$fct1, sapply(seq(nrow(df)), f))

这句话的英译中文是：“这将给您提供此情节：”（保留HTML，不解释）

ggplot(data = df, aes(y = fct2, x = val)) +
    stat_density_ridges(geom = "density_ridges_gradient",
                        calc_ecdf = T, 
                        quantile_fun = median, 
                        quantile_lines = T) +
    facet_wrap(~fct1, ncol = 1)