#> 6 2013 1 6 16 2355 #> # ... 还有 359 行
这些函数是对按排名筛选的补充。筛选会给你所有变量,每个观测占单独一行:
not_cancelled %>% group_by(year, month, day) %>% mutate(r = min_rank(desc(dep_time))) %>% filter(r %in% range(r)) #> Source: local data frame [770 x 20] #> Groups: year, month, day [365] #> #> year month day dep_time sched_dep_time dep_delay #>
计数
你已经见过 n(),它不接受任何参数,返回当前组的大小。要统计非缺失值的数量,请使用 sum(!is.na(x))。要统计不同(唯一)值的数量,请使用 n_distinct(x):
# 哪些目的地拥有最多的航空公司? not_cancelled %>% group_by(dest) %>% summarize(carriers = n_distinct(carrier)) %>% arrange(desc(carriers)) #> # A tibble: 104 × 2 #> dest carriers #>