← Лонгриды · Econometrics

Регрессия и OLS на пальцах

Без страха перед значками. Каждая формула проговорена словами — можно слушать в наушниках.

🎧 Озвучено OpenAI · голос: молодая женщина, московское произношение

Договоримся сразу: эконометрика пугает не идеями, а значками. Сами идеи простые и человеческие. Поэтому каждую формулу я проговариваю словами, медленно, как будто рисую её в воздухе.

Облако точек и прямая

У нас данные о домах: про каждый знаем площадь и цену продажи. Нанесём дома точками — по горизонтали площадь, по вертикали цена. Видно: чем больше площадь, тем дороже. Задача — провести через облако одну прямую, которая лучше всего описывает связь. Это и есть регрессия.

площадь (X) цена (Y) остаток ε̂
Оранжевая прямая — регрессия. Серые пунктиры — остатки: вертикальные промахи от точки до линии. OLS ставит линию так, чтобы сумма квадратов этих промахов была минимальной.
$Y = \beta_0 + \beta_1 X + \varepsilon$ «игрек равен бета-ноль плюс бета-один умножить на икс, плюс ошибка эпсилон». $\beta_0$ — высота линии (интерсепт), $\beta_1$ — наклон (на сколько растёт цена при +1 площади), $\varepsilon$ — необъяснённое: расстояние от точки до линии.

Метод наименьших квадратов

Линий через облако бесконечно много. Какую выбрать? Для каждого дома берём промах — расстояние до линии по вертикали. Плюсы и минусы сократились бы, поэтому каждый промах возводим в квадрат (заодно крупные штрафуются сильнее) и складываем. OLS выбирает линию, где эта сумма минимальна — будто каждая точка тянет линию пружинкой, и линия встаёт в равновесие.

$\displaystyle \min_{\beta_0,\beta_1}\ \sum_{i=1}^{N}\big(Y_i - \beta_0 - \beta_1 X_i\big)^2$ «сумма по всем домам от квадрата разницы между настоящей ценой и предсказанной». Минимум этой суммы и даёт лучшую линию.
$\hat\beta = (X'X)^{-1}X'Y$ «бета с крышечкой равна икс-штрих-икс в минус первой степени, умножить на икс-штрих-игрек». Крышечка = «оценка по данным». Считать руками не надо — ответ единственный и честный.

Насколько линия хороша — R²

Сначала смотрим, как цены разбросаны сами по себе: отклонения от средней цены, в квадрате, сложить — это общий разброс (TSS). Линия часть его объяснила (ESS), часть осталась в остатках (RSS). И есть тождество: что было = поняли + не поняли.

ESS — объяснено (95%) RSS TSS — весь разброс цен
$R^2 = ESS/TSS$ — доля «понятого». Здесь ≈ 0,95: площадь и расположение объясняют 95% разброса цен; красная полоска RSS — необъяснённые причуды домов.
$R^2 = \dfrac{ESS}{TSS} = 1 - \dfrac{RSS}{TSS}$ «эр-квадрат равен объяснённой части делить на общий разброс; или единица минус необъяснённое делить на общий разброс». 1 — линия объясняет всё; 0 — бесполезна.

Ловушка. $R^2$ никогда не падает при добавлении новой переменной — даже бессмысленной. Гнаться за высоким $R^2$, набивая модель, — самообман. Для честного сравнения есть скорректированный $R^2$, который штрафует за лишние переменные.

Связь — не причина

Регрессия описывает связь, но не доказывает причину. Если у больших домов выше цена — может, их просто строят в богатых районах, и дело в районе, а не в площади. Линия видит совпадение. Чтобы говорить о причине, нужны предположения — про пять китов честной регрессии в следующем тексте. А пока главное: регрессия — это самая аккуратная прямая через облако, и её наклон — главное слово.