←
PDF 258 / 520 Exercises
→
English · PDF 258
Original PDF page 258
中文 · PDF 258

练习

    1. tvhours 中有一些可疑的高数值。均值是一个好的汇总吗?
    1. 对于 gss_cat 中的每个因子,判断其水平的顺序是任意的还是有原则的。
    1. 为什么将 "Not applicable" 移到水平的最前面后,它在图中却移到了最底部?

修改因子水平

比改变水平顺序更强大的是改变水平的值。这允许你为出版澄清标签,并为高级展示合并水平。最通用且最强大的工具是 fct_recode()。它允许你重新编码或更改每个水平的值。例如,以 gss_cat$partyid 为例:

gss_cat %>% count(partyid) #> # A tibble: 10 × 2 #> partyid n #> #> 1 No answer 154 #> 2 Don't know 1 #> 3 Other party 393 #> 4 Strong republican 2314 #> 5 Not str republican 3032 #> 6 Ind,near rep 1791 #> # ... with 4 more rows

这些水平简短且不一致。让我们调整它们,使其更长并使用平行的结构:

gss_cat %>% mutate(partyid = fct_recode(partyid, "Republican, strong" = "Strong republican", "Republican, weak" = "Not str republican", "Independent, near rep" = "Ind,near rep", "Independent, near dem" = "Ind,near dem", "Democrat, weak" = "Not str democrat", "Democrat, strong" = "Strong democrat" )) %>% count(partyid) #> # A tibble: 10 × 2 #> partyid n #> #> 1 No answer 154