English · PDF 401
在上一章中,你学习了线性模型的工作原理,并掌握了一些基本工具,用于理解模型告诉你关于数据的哪些信息。上一章主要使用模拟数据集来帮助你了解模型的工作方式。本章将聚焦于真实数据,向你展示如何逐步构建模型以加深对数据的理解。
我们将利用这样一个事实:你可以把模型看作是将数据划分为模式和残差。我们先通过可视化发现模式,然后用模型使它们具体而精确。接着我们会重复这一过程,但用模型的残差替换原来的响应变量。目标是把数据和头脑中的隐式知识转化为定量模型中的显式知识。这使得知识更容易应用到新领域,也更容易被他人使用。
对于非常庞大和复杂的数据集,这将是一项繁重的工作。当然也有其他替代方法——一种更偏机器学习的方法是只关注模型的预测能力。这类方法往往产生黑箱:模型在生成预测方面表现出色,但你不知道为什么。这是一种完全合理的方法,但它使你难以将现实世界的知识应用到模型中。反过来,这也使得难以评估当基本条件发生变化时,模型能否长期继续有效。对于大多数实际模型,我