导入数据之后,最好先对数据进行整理(tidy)。整理数据是指将数据存储为一种一致的形式,使数据集的语义与其存储方式相匹配。简而言之,当数据是整洁的,每一列是一个变量,每一行是一个观测。整洁数据之所以重要,是因为一致的结构能让你把精力集中在关于数据的问题上,而不是费力地把数据转换成不同函数所需的正确形式。
得到整洁数据后,一个常见的首要步骤是对数据进行变换(transform)。变换包括筛选出感兴趣的观测(例如某个城市的所有人,或最近一年的所有数据)、创建由现有变量的函数构成的新变量(例如由速度和时间计算速度),以及计算一组汇总统计量(例如计数或均值)。整理与变换合称为数据处理(wrangling),因为让数据变成便于处理的形式,往往就像一场搏斗!
当你拥有了包含所需变量的整洁数据之后,就有两个主要的知识生成引擎:可视化和建模。它们各有互补的优势与劣势,因此任何真正的分析都会在两者之间反复迭代多次。
可视化(visualization)从根本上说是一种人类活动。一个好的可视化会向你展示意想不到的东西,或者引出关于数据的新问题。一个好的可视化还可能提示你问错了问题,或者需要收集不同的数据。可视化能给你带来惊喜,但它的扩展性并不好,因为需要人来解读。
模型(model)是与可视化互补的工具。当你把问题表述得足够精确之后,就可以用模型来回答它们。模型从根本上说是一种数学或计算工具,因此通常具有良好的扩展性。即使扩展性不佳,购买更多计算机通常也比购买更多大脑便宜!但每个模型都基于假设,而模型从本质上无法质疑自身的假设。这意味着模型从根本上无法给你带来惊喜。
数据科学的最后一步是交流(communication),这是任何数据分析项目中绝对关键的部分。如果你的模型和可视化让你很好地理解了数据,但你却无法将结果传达给他人,那也毫无意义。