PDF 95 / 520 Counts
English · PDF 95
Original PDF page 95
中文 · PDF 95

#> 6 2013 1 6 16 2355 #> # ... 还有 359 行

这些函数是对按排名筛选的补充。筛选会给你所有变量,每个观测占单独一行:

not_cancelled %>% group_by(year, month, day) %>% mutate(r = min_rank(desc(dep_time))) %>% filter(r %in% range(r)) #> Source: local data frame [770 x 20] #> Groups: year, month, day [365] #> #> year month day dep_time sched_dep_time dep_delay #> #> 1 2013 1 1 517 515 2 #> 2 2013 1 1 2356 2359 -3 #> 3 2013 1 2 42 2359 43 #> 4 2013 1 2 2354 2359 -5 #> 5 2013 1 3 32 2359 33 #> 6 2013 1 3 2349 2359 -10 #> # ... 还有 764 行,以及 13 个更多变量: #> # arr_time , sched_arr_time , #> # arr_delay , carrier , flight , #> # tailnum , origin , dest , #> # air_time , 距离 , 小时 , #> # 分钟 , time_hour , r

计数

你已经见过 n(),它不接受任何参数,返回当前组的大小。要统计非缺失值的数量,请使用 sum(!is.na(x))。要统计不同(唯一)值的数量,请使用 n_distinct(x):

# 哪些目的地拥有最多的航空公司? not_cancelled %>% group_by(dest) %>% summarize(carriers = n_distinct(carrier)) %>% arrange(desc(carriers)) #> # A tibble: 104 × 2 #> dest carriers #> #> 1 ATL 7 #> 2 BOS 7 #> 3 CLT 7 #> 4 ORD 7 #> 5 TPA 7