PDF 98 / 520 Ungrouping
English · PDF 98
Original PDF page 98
中文 · PDF 98

(per_month <- summarize(per_day, flights = sum(flights))) #> 来源:本地数据框 [12 x 3] #> 分组:year [?] #> #> year month flights #> #> 1 2013 1 27004 #> 2 2013 2 24951 #> 3 2013 3 28834 #> 4 2013 4 28330 #> 5 2013 5 28796 #> 6 2013 6 28243 #> # ... 还有 6 行 (per_year <- summarize(per_month, flights = sum(flights))) #> # 一个 tibble:1 × 2 #> year flights #> #> 1 2013 336776

在逐步汇总时需要小心:对于求和与计数来说没问题,但你需要考虑加权平均数和方差,而对于基于排名的统计量(如中位数)则无法精确做到。换句话说,各组之和的总和就是整体总和,但各组中位数的中位数并不是整体中位数。

取消分组

如果你需要移除分组,回到对未分组数据的操作,可以使用 ungroup():

daily %>% ungroup() %>% # 不再按日期分组 summarize(flights = n()) # 所有航班 #> # 一个 tibble:1 × 1 #> flights #> #> 1 336776

练习

    1. 头脑风暴出至少五种不同的方法来评估一组航班的典型延误特征。考虑以下场景: