← Карта тем · PDF Vo3

§3 Доверительные интервалы, прогноз, форма модели

По слайдам Vo3. Доверительные/прогнозные интервалы и спецификация: лог-преобразования, дамми, взаимодействия, полиномы. Это прямой фундамент задач 1–3 мок-экзамена.

3.1 Доверительный и прогнозный интервал

CI для коэффициента (под AN)
$$\hat\beta_j \pm t_{1-\alpha/2,\,N-K-1}\cdot \widehat{\operatorname{se}}(\hat\beta_j)$$

Если интервал не содержит 0 — коэффициент значим на уровне $\alpha$ (эквивалентно $t$-тесту). Ширина растёт со стандартной ошибкой (мультиколлинеарность, малое $N$).

Прогноз и прогнозный интервал для нового $x_0$
$$\hat y_0 = x_0'\hat\beta, \qquad \hat y_0 \pm t\cdot \hat\sigma\sqrt{1 + x_0'(X'X)^{-1}x_0}$$

«$1+$» — это дисперсия новой ошибки плюс неопределённость оценки $\hat\beta$. Интервал для среднего $E(y_0)$ — без единицы. Ширина растёт с удалением $x_0$ от центра данных — экстраполяция опасна.

3.2 Лог-модели — интерпретация коэффициентов

ФормаМодельИнтерпретация $\beta_1$
level–level$Y=\beta_0+\beta_1 X$$X{+}1 \Rightarrow Y$ на $\beta_1$ единиц
log–level (semi-log)$\log Y=\beta_0+\beta_1 X$$X{+}1 \Rightarrow Y$ на $\approx 100\beta_1\%$
level–log$Y=\beta_0+\beta_1\log X$$X{+}1\% \Rightarrow Y$ на $\approx \beta_1/100$ единиц
log–log$\log Y=\beta_0+\beta_1\log X$эластичность: $X{+}1\% \Rightarrow Y$ на $\beta_1\%$

В мок-экзамене модель log–level: $\log(price)=\beta_0+\beta_1\,size+\dots$. Значит $\hat\beta_1=0{,}0288 \Rightarrow$ +1 кв.фут площади увеличивает цену примерно на $2{,}88\%$ (точно: $e^{\beta_1}-1$).

3.3 Дамми-переменные

Дамми = сдвиг интерсепта
$$Y=\beta_0+\beta_1 X + \beta_2 D \;\Rightarrow\; \begin{cases} \beta_0+\beta_1 X, & D=0 \\ (\beta_0+\beta_2)+\beta_1 X, & D=1 \end{cases}$$

Две параллельные линии с одинаковым наклоном $\beta_1$; $\beta_2$ — разница уровней (интерсептов), НЕ наклонов. Категориальная переменная с $m$ уровнями → $m-1$ дамми; пропущенный уровень — baseline (reference). Включить все $m$ → ловушка дамми (нарушение AR).

В лог-модели коэффициент дамми $\beta_2$ читается как процентная разница уровня $Y$ относительно baseline. Мок Q1: $D_1$ (лучшая локация) — baseline; $\hat\beta_{D_3}=-0{,}153$ значим → дома в локации 3 примерно на 15% дешевле, чем в локации 1, при прочих равных.

3.4 Взаимодействия и полиномы

Взаимодействие — разные наклоны
$$Y=\beta_0+\beta_1 X_1+\beta_2 X_2+\beta_3 X_1 X_2 \;\Rightarrow\; \frac{\partial Y}{\partial X_1}=\beta_1+\beta_3 X_2$$

При взаимодействии эффект $X_1$ зависит от уровня $X_2$. Поэтому $\beta_2$ сам по себе — это наклон по $X_2$ только при $X_1=0$, а не «в общем». Ошибка в мок Q3a именно об этом.

Квадратичный член и вершина параболы
$$Y=\gamma_0+\gamma_1 X+\gamma_2 X^2+\dots \;\Rightarrow\; \frac{\partial Y}{\partial X}=\gamma_1+2\gamma_2 X, \qquad X^*=-\frac{\gamma_1}{2\gamma_2}$$

Эффект $X$ нелинеен. Вершина $X^*$ — точка максимума (если $\gamma_2<0$) или минимума. Мок Q2: $\gamma_1=0{,}0563,\ \gamma_2=-2{,}13\cdot10^{-4}\Rightarrow X^*=0{,}0563/(2\cdot2{,}13\cdot10^{-4})\approx 132$ — после этого размера предельный эффект площади на лог-цену становится отрицательным. Включать $X^2$ стоит, если его $t$ значим (здесь $t=-17{,}5$, да).

На экзамене. Прогноз $\log(price)$ для дома 120 м² в локации 3 (мок Q2a): подставить $size=120$ в $\hat\gamma_0+\hat\gamma_1\cdot120+\hat\gamma_2\cdot120^2+\hat\gamma_{D_3}$. «Нужен ли квадрат?» → смотри $t$/p квадратичного члена. «Нужна ли вообще $size$?» → $F$-тест совместной значимости $size$ и $size^2$, не отдельные $t$.