Если бы мы собрали другую выборку, наклон получился бы чуть другим. Поэтому мало назвать число — надо сказать, насколько мы в нём уверены. Этим занимается инференция. Три инструмента: t-тест, доверительный интервал и прогноз.
t-тест: коэффициент вообще не ноль?
Нулевая гипотеза: пусть коэффициент на самом деле равен нулю (переменная не влияет). Вопрос: насколько наша оценка далека от нуля по меркам её собственной погрешности — стандартной ошибки.
$t = \dfrac{\hat\beta_j - \beta_j^0}{\widehat{\operatorname{se}}(\hat\beta_j)}$, для $H_0:\beta_j=0$ просто $t=\dfrac{\hat\beta_j}{\widehat{\operatorname{se}}(\hat\beta_j)}$
«тэ равно оценка коэффициента минус проверяемое значение, делённое на стандартную ошибку». По смыслу: на сколько стандартных ошибок оценка отстоит от нуля. Дальше двух — далеко, случайностью не объяснить.
Если |t| попадает в красные хвосты (грубо |t| > 2), оценка слишком далека от нуля, чтобы быть случайностью — отвергаем H₀, коэффициент значим. p-value — это площадь хвоста за наблюдённым t: вероятность увидеть такое (или круче), если бы коэффициент был ноль.
Не молись на звёздочки. Граница 0,05 — соглашение, не закон природы. p = 0,06 и p = 0,04 почти одинаковы, хотя одна «незначима», другая «значима». Думай о величине эффекта, а не только о звёздочках.
t-тест отвечает только «да/нет». Доверительный интервал честнее: он даёт целый диапазон значений коэффициента, совместимых с данными.
$\hat\beta_j \pm t_{1-\alpha/2}\cdot \widehat{\operatorname{se}}(\hat\beta_j)$ ≈ $\hat\beta_j \pm 2\,\widehat{\operatorname{se}}$
«оценка плюс-минус критическое значение, умноженное на стандартную ошибку». Для 95% и большой выборки критическое ≈ 1,96, почти двойка. Правило на салфетке: оценка плюс-минус две стандартные ошибки.
Связь с t-тестом: интервал не накрывает 0 ⟺ p < 0,05 (значим). Узкий интервал — оценка точная; широкий (от большого минуса до большого плюса) — мы мало что знаем, даже если формально «значим».
Тонкость интерпретации. 95% доверия ≠ «вероятность 95%, что истина в этом интервале».
Истина — фиксированное число, она либо внутри, либо нет. Правильно так: если повторять эксперимент много раз и каждый раз строить интервал, то 95% таких интервалов накроют истину.
F-тест: значима ли группа переменных сразу
t-тест — про один коэффициент. А если надо проверить несколько разом (например, нужна ли вообще площадь, когда в модели и площадь, и её квадрат)? Берём полную модель и урезанную (без проверяемых переменных) и сравниваем необъяснённое (RSS).
Выбросив переменные, мы всегда теряем часть объяснённого — RSS растёт. F спрашивает: насколько он вырос? Сильно → переменные важны (оставляем); чуть-чуть → бесполезны.
$F = \dfrac{(RSS_r - RSS_u)/q}{RSS_u/(N-K-1)}$
«прирост необъяснённого от урезания, делённый на число выброшенных переменных, и всё это делить на необъяснённое полной модели на степень свободы». Большой F и малая p → переменные значимы как группа. Первая строка F в распечатке проверяет сразу все наклоны.
Прогноз: два интервала, которые путают
Пришёл новый дом с известной площадью. Точечный прогноз — подставили площадь в уравнение. А вокруг него — два разных интервала.
Доверительный (для среднего): где в среднем лежит цена всех домов такой площади?
Прогнозный (для конкретного дома): в каком диапазоне окажется цена вот этого одного дома? Он всегда шире.
Обе полосы расширяются к краям — далеко от центра данных модель видела мало примеров. Прогнозная шире, потому что добавляет личную случайность конкретного дома.
$\hat y_0 \pm t\cdot\hat\sigma\sqrt{\,\mathbf{1}+x_0'(X'X)^{-1}x_0\,}$ (для среднего — без единицы)
Лишняя единица под корнем — это личная дисперсия нового дома (его ремонт, вид, настроение продавца). У среднего она усредняется и исчезает, поэтому доверительный интервал уже. Прогнозировать далеко за пределами данных — натягивать линию в темноту: интервал раздувается, и правильно делает.
Итог
Честный эконометрист никогда не называет число без меры уверенности. t-тест — на сколько se коэффициент отстоит от нуля. Доверительный интервал — диапазон правдоподобных значений; не накрывает 0 → значим; узкий → точно. F-тест — группа переменных разом, через прирост RSS. Прогноз — точка плюс интервал, для конкретного объекта шире на его личную случайность (та самая «единичка под корнем»).