中文 · PDF 176
学习那些与之配合使用的工具,因为它们具有潜在的统一性。
- 将变量放在列中有其独特的优势,因为它能让 R 的向量化特性大放异彩。正如你在第 56 页的“实用的创建函数”和第 66 页的“实用的汇总函数”中所学到的,大多数 R 内置函数都可以处理值的向量。这使得转换整洁数据感觉特别自然。
dplyr、ggplot2 以及 tidyverse 中的所有其他包都是为处理整洁数据而设计的。下面是几个小例子,展示你可以如何处理 table1:
# 计算每万人的比率 table1 %>% mutate(rate = cases / population * 10000) #> # A tibble: 6 × 5 #> country year cases population rate #> #> 1 Afghanistan 1999 745 19987071 0.373 #> 2 Afghanistan 2000 2666 20595360 1.294 #> 3 Brazil 1999 37737 172006362 2.194 #> 4 Brazil 2000 80488 174504898 4.612 #> 5 China 1999 212258 1272915272 1.667 #> 6 China 2000 213766 1280428583 1.669 # 计算每年的病例数 table1 %>% count(year, wt = cases) #> # A tibble: 2 × 2 #> year n #> #> 1 1999 250740 #> 2 2000 296920 # 可视化随时间的变化 library(ggplot2) ggplot(table1, aes(year, cases)) + geom_line(aes(group = country), color = "grey50") + geom_point(aes(color = country))