中文 · PDF 76
- d. 夏季(7月、8月和9月)出发
- e. 到达晚点超过两小时,但出发并未晚点
- f. 至少延误一小时,但在飞行中弥补了超过30分钟
- g. 在午夜至早上6点之间(含)出发
-
- 另一个有用的 dplyr 筛选辅助函数是 between()。它的作用是什么?你能用它来简化回答前面练习所需的代码吗?
-
- 有多少航班的 dep_time 缺失?还有哪些变量缺失?这些行可能代表什么?
-
- 为什么 NA ^ 0 不缺失?为什么 NA | TRUE 不缺失?为什么 FALSE & NA 不缺失?你能总结出一般规则吗?(NA * 0 是一个棘手的反例!)
使用 arrange() 对行排序
arrange() 的工作方式与 filter() 类似,区别在于它不是选择行,而是改变行的顺序。它接受一个数据框和一组用于排序的列名(或更复杂的表达式)。如果你提供多个列名,每个额外的列将用于打破前面各列值中的并列关系:
arrange(flights, year, month, day) #> # A tibble: 336,776 × 19 #> year month day dep_time sched_dep_time dep_delay #> #> 1 2013 1 1 517 515 2 #> 2 2013 1 1 533 529 4 #> 3 2013 1 1 542 540 2 #> 4 2013 1 1 544 545 -1 #> 5 2013 1 1 554 600 -6 #> 6 2013 1 1 554 558 -4 #> # ... with 3.368e+05 more rows, and 13 more variables: #> # arr_time , 计划到达时间_arr_time , 到达延误_delay , #> # 航空公司 , 航班 , 机尾号 , 出发地 , #> # 目的地 , 飞行时间_time , 距离 , 小时 , #> # 分钟 , time_hour
使用 desc() 按某列降序重新排列:
arrange(flights, desc(arr_delay)) #> # A tibble: 336,776 × 19 #> year month day dep_time sched_dep_time dep_delay