←
PDF 175 / 520 table4b # population #> # A tibble: 3 × 3 #> country 1999 2000 #> \ #> 1 Afghanistan 19987071 20
→
English · PDF 175
Original PDF page 175
中文 · PDF 175

table4b # population #> # A tibble: 3 × 3 #> country 1999 2000 #> * #> 1 阿富汗 19987071 20595360 #> 2 巴西 172006362 174504898 #> 3 中国 1272915272 1280428583

这些都是同一底层数据的不同表示形式,但它们并非同样易于使用。其中一个数据集,即整洁数据集,在 tidyverse 中处理起来会容易得多。

有三条相互关联的规则使数据集变得整洁:

    1. 每个变量必须有自己的一列。
    1. 每个观测必须有自己的一行。
    1. 每个值必须有自己的一格。

图 9-1 直观地展示了这些规则。

图 9-1. 以下三条规则使数据集变得整洁:变量在列中,观测在行中,值在格中

这三条规则是相互关联的,因为不可能只满足其中两条而不满足第三条。这种相互关联性引出了一组更为简单的实用操作指南:

    1. 将每个数据集放入一个 tibble 中。
    1. 将每个变量放入一列中。

在本例中,只有 table1 是整洁的。它是唯一一种每一列都是一个变量的表示形式。

为什么要确保数据是整洁的?这有两个主要优点:

  • 选择一种一致的数据存储方式有一个总体上的好处。如果你拥有一致的数据结构,那么就更容易