PDF 77 / 520 Exercises
English · PDF 77
Original PDF page 77
中文 · PDF 77

#> #> 1 2013 1 9 641 900 1301 #> 2 2013 6 15 1432 1935 1137 #> 3 2013 1 10 1121 1635 1126 #> 4 2013 9 20 1139 1845 1014 #> 5 2013 7 22 845 1600 1005 #> 6 2013 4 10 1100 1900 960 #> # ... 还有 3.368e+05 行,以及 13 个更多变量:#> # arr_time , sched_arr_time , arr_delay , #> # carrier , flight , tailnum , origin , #> # dest , air_time , distance , 小时 , #> # 分钟 , time_hour ,

缺失值总是排在最后:

df <- tibble(x = c(5, 2, NA)) arrange(df, x) #> # A tibble: 3 × 1 #> x #> #> 1 2 #> 2 5 #> 3 NA arrange(df, desc(x)) #> # A tibble: 3 × 1 #> x #> #> 1 5 #> 2 2 #> 3 NA

练习

    1. 如何使用 arrange() 将所有缺失值排在最前面?(提示:使用 is.na()。)
    1. 对 flights 排序,找出延误最严重的航班。找出起飞最早的航班。
    1. 对 flights 排序,找出飞行速度最快的航班。
    1. 哪些航班飞行距离最长?哪些最短?

使用 select() 选择列

遇到包含数百甚至数千个变量的数据集是很常见的情况。在这种情况下,第一个挑战通常是缩小范围,找到你真正感兴趣的变量。select() 允许你