Лінійна регресія: парна та багатовимірна
Розділ: Методи психології та соціології
📌 Про що ця тема
Лінійна регресія — це статистичний метод, який описує, як одна змінна (залежна, Y) змінюється під впливом однієї чи кількох інших (незалежних, предикторів X). На іспиті перевіряють розуміння рівняння регресії, інтерпретацію коефіцієнтів, відмінність від кореляції та вміння читати основні показники якості моделі. Ключове поняття — прогнозування значення Y за відомими X.
📖 Головне
• Регресія vs кореляція: кореляція показує лише силу й напрям звʼязку (симетрична), а регресія будує модель прогнозу Y через X (асиметрична — важливо, що залежне, а що незалежне).
• Парна (проста) лінійна регресія: один предиктор. Рівняння: Y = a + b·X, де a — вільний член (константа, значення Y при X=0), b — коефіцієнт регресії (нахил).
• Коефіцієнт b показує, на скільки одиниць зміниться Y при зростанні X на одну одиницю.
• Багатовимірна (множинна) регресія: кілька предикторів. Y = a + b₁·X₁ + b₂·X₂ + … + bₖ·Xₖ. Кожен bᵢ — вплив свого X за умови, що інші незмінні («при інших рівних»).
• Метод найменших квадратів (МНК): коефіцієнти підбирають так, щоб сума квадратів відхилень фактичних Y від передбачених була мінімальною.
• Залишки (помилки) — різниця між реальним і прогнозованим значенням Y.
• Коефіцієнт детермінації R² (від 0 до 1): частка дисперсії Y, яку пояснює модель. R²=0,6 → модель пояснює 60% варіації.
• Стандартизовані коефіцієнти (бета) дають змогу порівняти силу впливу предикторів у різних одиницях виміру.
• Умови застосування: лінійність звʼязку, кількісні змінні, нормальність розподілу залишків, відсутність сильної мультиколінеарності (предиктори не мають дублювати одне одного).
🔢 Як це працює на прикладі
Дослідник вивчає звʼязок кількості годин підготовки (X) і бала за тест (Y). Отримано рівняння: Y = 20 + 8·X.
• Крок 1. Константа a=20 → без підготовки (X=0) очікуваний бал 20.
• Крок 2. Коефіцієнт b=8 → кожна додаткова година підготовки додає 8 балів.
• Крок 3. Прогноз для 5 годин: Y = 20 + 8·5 = 60 балів.
• Крок 4. Якщо R²=0,49, модель пояснює 49% розкиду балів; решту визначають інші чинники.
Множинний приклад: Y = 10 + 8·X₁ + 3·X₂, де X₁ — години, X₂ — попередній рівень знань. При X₁=5, X₂=4: Y = 10 + 40 + 12 = 62.
⚠️ Типові помилки
• Плутають залежну й незалежну змінну, бо кореляція симетрична, а регресія — ні; від перестановки рівняння змінюється.
• Інтерпретують звʼязок як причинність: регресія показує статистичний звʼязок, а не доводить, що X спричиняє Y.
• Вважають R² мірою напряму звʼязку — насправді він лише про частку поясненої дисперсії (завжди ≥0).
• Порівнюють звичайні (нестандартизовані) коефіцієнти з різних одиниць — для порівняння сили потрібні бета.
• Забувають, що bᵢ у множинній моделі діє «при незмінних інших предикторах».
🎯 Що завчити напамʼять
• Парна: Y = a + b·X. Множинна: Y = a + b₁X₁ + … + bₖXₖ.
• a — значення Y при X=0; b — зміна Y на одиницю X.
• R² ∈ [0;1] — частка поясненої дисперсії.
• Метод оцінки — найменших квадратів (мінімум суми квадратів залишків).
• Регресія ≠ причинність.
🧠 Перевір себе
1. Що показує коефіцієнт b у рівнянні Y = a + b·X?
2. Чим множинна регресія відрізняється від парної?
3. Що означає R² = 0,7?
4. Чи доводить значущий коефіцієнт регресії, що X спричиняє Y?
Відповіді: 1 — на скільки одиниць зміниться Y при зростанні X на одну одиницю; 2 — у множинній кілька предикторів, кожен впливає при інших незмінних; 3 — модель пояснює 70% дисперсії залежної змінної; 4 — ні, лише статистичний звʼязок, а не причинність.