将数据分成组的R语言操作

7
我有一个数据框,想把其中一列的值分成n组。所以我有一个包含大约10k条记录的列data$dist,其中最大值为23180,最小值为8951。我想把这些值分成10组,每组具有相等的范围,即(23180-8951)/10 = 1423。这意味着所有在8951和10374之间的值都属于第一组,以此类推。我该怎么做?

请参考?cut,并与seq一起使用。如果您想要每个组具有相等数量的观测值而不是相等范围,请使用quantile代替seq - Gregor Thomas
1个回答

11
你可以使用cutsplit,就像下面的示例一样:
set.seed(2015)
d <- data.frame(i=1:20,z=runif(20))
#     i          z
# 1   1 0.06111892
# 2   2 0.83915986
# 3   3 0.29861322
# 4   4 0.03143242
# 5   5 0.13857171
# 6   6 0.35318471
# 7   7 0.49995552
# 8   8 0.07707116
# 9   9 0.65134483
# 10 10 0.51172371
# 11 11 0.70285557
# 12 12 0.39172125
# 13 13 0.03306277
# 14 14 0.40940319
# 15 15 0.74234713
# 16 16 0.88301877
# 17 17 0.26623321
# 18 18 0.07427093
# 19 19 0.81368426
# 20 20 0.38194719

split(d,cut(d$i,seq(0,20,length.out=5)))
# $`(0,5]`
#   i          z
# 1 1 0.06111892
# 2 2 0.83915986
# 3 3 0.29861322
# 4 4 0.03143242
# 5 5 0.13857171
# 
# $`(5,10]`
#     i          z
# 6   6 0.35318471
# 7   7 0.49995552
# 8   8 0.07707116
# 9   9 0.65134483
# 10 10 0.51172371
# 
# $`(10,15]`
#     i          z
# 11 11 0.70285557
# 12 12 0.39172125
# 13 13 0.03306277
# 14 14 0.40940319
# 15 15 0.74234713
# 
# $`(15,20]`
#     i          z
# 16 16 0.88301877
# 17 17 0.26623321
# 18 18 0.07427093
# 19 19 0.81368426
# 20 20 0.38194719

网页内容由stack overflow 提供, 点击上面的
可以查看英文原文,
原文链接