←
PDF 397 / 520 Exercises
→
English · PDF 397
Original PDF page 397
中文 · PDF 397

请注意,在数据范围之外进行外推显然是不好的。这就是用多项式近似函数的缺点。但这也是每个模型都存在的非常真实的问题:当你开始在所观察到的数据范围之外进行外推时,模型永远无法告诉你这种行为是否真实。你必须依靠理论和科学。

练习

    1. 如果你在分析 sim2 时使用不含截距的模型,重复该分析会发生什么?模型方程会发生什么变化?预测结果会发生什么变化?
    1. 使用 model_matrix() 来探索我为 sim3 和 sim4 拟合的模型所生成的方程。为什么 * 是表示交互项的一个好简写?
    1. 使用基本原理,将下面两个模型中的公式转换为函数。(提示:先将分类变量转换为 0-1 变量。)

mod1 <- lm(y ~ x1 + x2, data = sim3)

mod2 <- lm(y ~ x1 * x2, data = sim3)

    1. 对于 sim4,mod1 和 mod2 哪个更好?我认为 mod2 在消除模式方面做得稍好一些,但这个差异相当微妙。你能想出一个图来支持我的观点吗?

缺失值

缺失值显然无法传达任何关于变量之间关系的信息,因此建模函数会丢弃任何包含缺失值的行。R 的默认行为是静默地丢弃它们,但 options(na.action = na.warn)(在准备工作部分运行过)可以确保你收到警告:

df <- tribble( ~x, ~y, 1, 2.2, 2, NA, 3, 3.5, 4, 8.3, NA, 10 )