←
PDF 160 / 520 Factors
→
English · PDF 160
Original PDF page 160
中文 · PDF 160

#> encoding confidence #> 1 KOI8-R 0.42

guess_encoding() 的第一个参数既可以是一个文件路径,也可以像本例中那样是一个原始向量(如果字符串已经在 R 中,这会很有用)。

编码是一个丰富而复杂的话题,我在这里只是浅尝辄止。如果你想了解更多,我建议阅读 < 处的详细说明。http://kunststube.net/encoding/>.

因子

R 使用因子来表示具有一组已知可能取值的分类变量。给 parse_factor() 传入一个已知水平的向量,每当出现意外值时就会生成一条警告:

fruit <- c("apple", "banana") parse_factor(c("apple", "banana", "bananana"), levels = fruit) #> Warning: 1 parsing failure. #> row col expected actual #> 3 -- value in level set bananana #> [1] apple banana #> attr(,"problems") #> # A tibble: 1 × 4 #> row col expected actual #> #> 1 3 NA value in level set bananana #> Levels: apple banana

但如果你有很多有问题的条目,通常更简单的做法是先将它们保留为字符向量,然后使用你将在第 11 章和第 12 章中学到的工具来清理它们。

日期、日期时间和时间

你可以根据需要从三种解析器中选择:日期(自 1970-01-01 以来的天数)、日期时间(自 1970-01-01 午夜以来的秒数)或时间(自午夜以来的秒数)。在不带任何额外参数调用时:

  • parse_datetime() 期望一个 ISO8601 日期时间。ISO8601 是一项国际标准,其中日期的各个组成部分按从大到小的顺序组织:年、月、日、时、分、秒。