PDF 15 / 520 Python, Julia, and Friends
English · PDF 15
Original PDF page 15
中文 · PDF 15

本书所述内容中,你将学习 sparklyr、rhipe 和 ddr 等新工具,以在完整数据集上解决该问题。

Python、Julia 及其他语言

在本书中,你不会学到任何关于 Python、Julia 或其他任何对数据科学有用的编程语言的知识。这并不是因为我们认为这些工具不好。它们并不差!实际上,大多数数据科学团队都会混合使用多种语言,通常至少包括 R 和 Python。

然而,我们坚信一次精通一种工具才是最好的做法。如果你深入钻研,而不是把精力分散到许多主题上,你会进步得更快。这并不意味着你应该只懂一样东西,只是说如果你一次专注于一件事,通常会学得更快。你应该在整个职业生涯中努力学习新事物,但在进入下一个有趣的东西之前,要确保你的理解是扎实的。

我们认为 R 是开启数据科学之旅的绝佳起点,因为它是一个从头开始设计以支持数据科学的环境。R 不仅是一门编程语言,还是一个用于数据科学的交互式环境。为了支持交互,R 比许多同类语言灵活得多。这种灵活性也有其缺点,但最大的优点是,可以非常容易地为数据科学流程的特定部分演化出量身定制的语法。这些迷你语言帮助你以数据科学家的方式思考问题,同时支持你的大脑与计算机之间的流畅交互。

非矩形数据

本书只专注于矩形数据:即每个值都与一个变量和一个观测相关联的值的集合。有许多数据集并不天然符合这种范式:包括图像、声音、树形结构和文本。但矩形数据框在科学和工业中极为常见,我们相信它们是开启数据科学之旅的绝佳起点。

假设确认

可以将数据分析分为两大阵营:假设生成和假设确认(有时称为验证