← Лонгриды · Econometrics

Пять предположений регрессии

И как глазами понять, что что-то сломалось. Формулы проговорены словами.

🎧 Озвучено OpenAI · голос: молодая женщина, московское произношение

Линия описывает связь, но доверять ей как истине можно лишь при пяти условиях. В курсе их обозначают: AL, AR, AX, AH, AN. За каждым — простая человеческая мысль. Главный инструмент проверки — график остатков: хорошая модель оставляет после себя бесформенный ровный шум.

КодСмыслЕсли сломано
ALЛинейность — связь прямая, не дугасистематический изгиб в остатках
ARПолный ранг — переменные не дублируют друг другамультиколлинеарность: оценки скачут
AXЭкзогенность — ошибка не связана с Xсмещение; не лечится данными
AHГомоскедастичность — разброс ошибок одинаковстандартные ошибки врут
ANНормальность ошибоктесты на малой выборке неточны

AL: линейность — ищем узор в остатках

На графике «предсказания ↔ остатки» при выполненной линейности точки — бесформенное облако вокруг нуля. Если виден изгиб, «улыбка» — данные кричат: связь не прямая. Лечение — добавить квадрат переменной.

✓ хорошо: бесформенно ✗ дуга: связь не прямая
Слева остатки — ровный шум вокруг нуля (линейность ок). Справа видна «улыбка» — модель описывает кривую связь палкой; нужен квадратичный член.

AX: экзогенность — самое коварное

$E[\varepsilon \mid X] = 0$ «среднее значение ошибки при данных иксах равно нулю». В необъяснённом не должно прятаться ничего, что влияет на Y и связано с X.

Пример: объясняем зарплату образованием, но забыли про способности. Способный и учится дольше, и зарабатывает больше — способности сидят в ошибке и связаны с образованием. Тогда наклон при образовании завышен. Это единственное нарушение, которое не лечится количеством данных: миллион наблюдений просто аккуратно подтвердят неправильный ответ.

AH: гомоскедастичность — ищем воронку

$V(\varepsilon_i \mid X) = \sigma^2\ \text{— одинакова для всех}$ «дисперсия ошибки при любых иксах постоянна и равна сигма-квадрат».
✓ ровная полоса ✗ воронка: разброс растёт
Раструб справа — гетероскедастичность (как с тратами: у богатых разброс огромен). Наклоны остаются честными, но стандартные ошибки врут, значит звёздочки значимости обманывают. Проверка — тест Бройша-Пагана.
Правило чтения теста. Малая p-value (<0,05) → отвергаем $H_0$. У Бройша-Пагана $H_0$ = «разброс одинаков», поэтому малая p — это плохо (гетероскедастичность есть). В примере с домами p ≈ 0,54 — большая, спокойная: всё ровно.

AN: нормальность — Q-Q график

Если ошибки нормальны, точки на квантиль-квантильном (Q-Q) графике ложатся на диагональ. Убегают на хвостах — нормальность под вопросом. Числовой тест — Жарка-Бера ($H_0$ = «нормально»). В примере с домами p ≈ 0,30 — нормальность не отвергаем.

теоретические квантили (нормаль) → точки на диагонали → ошибки нормальны ✓
Точки легли на диагональ — распределение остатков близко к нормальному. Ненормальность часто лечится логарифмом: кривое распределение цены выпрямляется в колокол — поэтому в эконометрике так любят $\log$.

Зачем всё это — Гаусс-Марков

Если выполнены первые четыре (AL, AR, AX, AH), OLS — наилучшая оценка среди честных линейных способов, с наименьшим разбросом (свойство BLUE). Важно: для этого не нужна нормальность. Нормальность нужна лишь для точности тестов на малой выборке — частая путаница на экзамене.

Компас чтения регрессии. Сначала смысл наклонов → потом график остатков (узор? воронка?) → потом Q-Q → и только если картинки спокойны, доверяй звёздочкам. Остатки — это совесть регрессии. Слушай их.