←
PDF 191 / 520 give them the generic name "key". We know the cells represent the count of cases, so we'll use t
→
English · PDF 191
Original PDF page 191
中文 · PDF 191

给它们一个通用名称 "key"。我们知道这些单元格表示病例数,所以我们使用变量 cases。当前的表示形式中有很多缺失值,所以暂时我们使用 na.rm,以便专注于存在的值:

who1 <- who %>% gather( new_sp_m014:newrel_f65, key = "key", value = "cases", na.rm = TRUE ) who1 #> # A tibble: 76,046 × 6 #> country iso2 iso3 year key cases #> * #> 1 Afghanistan AF AFG 1997 new_sp_m014 0 #> 2 Afghanistan AF AFG 1998 new_sp_m014 30 #> 3 Afghanistan AF AFG 1999 new_sp_m014 8 #> 4 Afghanistan AF AFG 2000 new_sp_m014 52 #> 5 Afghanistan AF AFG 2001 new_sp_m014 129 #> 6 Afghanistan AF AFG 2002 new_sp_m014 90 #> # ... 还有 7.604e+04 行

我们可以通过计数来初步了解新 key 列中值的结构:

who1 %>% count(key) #> # A tibble: 56 × 2 #> key n #> #> 1 new_ep_f014 1032 #> 2 new_ep_f1524 1021 #> 3 new_ep_f2534 1021 #> 4 new_ep_f3544 1021 #> 5 new_ep_f4554 1017 #> 6 new_ep_f5564 1017 #> # ... 还有 50 行

稍加思考和一些实验,你或许能自己解析出其中的规律,但幸运的是我们手头有数据字典。它告诉我们:

    1. 每列的前三个字母表示该列包含的是新发还是旧发结核病病例。在这个数据集中,每列都包含新发病例。
    1. 接下来的两个字母描述结核病的类型:
    • rel 代表复发病例。