Zpět na přehled
Lineární regrese
Matematika
Vysoká škola
Petr
25.08.2026
Lineární regrese je fundamentální statistická metoda pro modelování lineárního vztahu mezi dvěma proměnnými. Tematická jednotka se zaměřuje na teoretické principy, odhad parametrů metodou nejmenších čtverců a praktickou interpretaci výsledků v kontextu inferenciální statistiky.
Osnova hodiny
1. Úvod do regresní analýzy
- Definice regresní analýzy a její role v inferenciální statistice
- Rozdíl mezi deskriptivní a inferenční funkcí modelu
- Praktické aplikace lineární regrese v ekonomii, biologii a dalších oborech
- Motivace: proč studovat lineární závislost proměnných
2. Lineární regresní model
- Specifikace jednoduchého regresního modelu: $Y_i = \beta_0 + \beta_1 X_i + \varepsilon_i$
- Interpretace parametrů $\beta_0$ (úsek) a $\beta_1$ (sklon)
- Chybová složka $\varepsilon_i$ a předpoklady (Gauss-Markovovy předpoklady)
- Rozlišení mezi populačním modelem a výběrovým modelem
- Geometrická interpretace regresní přímky
3. Metoda nejmenších čtverců (OLS)
- Princip minimalizace součtu kvadrátů reziduí: $\min \sum_{i=1}^{n} (y_i - \hat{y}_i)^2$
- Odvození normálních rovnic prostřednictvím parciálních derivací
- Odhady parametrů: $\hat{\beta}_1 = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sum_{i=1}^{n}(x_i - \bar{x})^2} = \frac{Cov(X,Y)}{Var(X)}$
- $\hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x}$
- Vlastnosti OLS odhadů (nestrannost, konzistence, eficientnost)
4. Analýza variability a determinační index
- Rozklad celkové variability: $SST = SSR + SSE$
- Součet čtverců: SST (Total), SSR (Regression), SSE (Error/Residuals)
- Koeficient determinace: $R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}$
- Interpretace $R^2$ jako podíl vysvětlené variability
- Omezení koeficientu determinace a jeho modifikace
- Koreláční koeficient a jeho vztah k $\hat{\beta}_1$
5. Odhady rozptylů a standardní chyby
- Odhad rozptylu chybové složky: $\hat{\sigma}^2 = \frac{SSE}{n-2} = MSE$
- Rozptyl odhadnutého parametru: $Var(\hat{\beta}_1) = \frac{\sigma^2}{\sum_{i=1}^{n}(x_i - \bar{x})^2}$
- Standardní chyba regresního koeficientu: $SE(\hat{\beta}_1) = \sqrt{\hat{Var}(\hat{\beta}_1)}$
- Standardní chyba úseku: $SE(\hat{\beta}_0)$
- Faktory ovlivňující přesnost odhadů
6. Statistická inference
- Testování hypotéz o regresních parametrech (zpravidla $H_0: \beta_1 = 0$)
- Testová statistika: $t = \frac{\hat{\beta}_1}{SE(\hat{\beta}_1)} \sim t_{n-2}$
- Konstruování intervalu spolehlivosti: $\hat{\beta}_1 \pm t_{\alpha/2, n-2} \cdot SE(\hat{\beta}_1)$
- ANOVA tabulka v regresní analýze (F-test)
- Vztah mezi t-testem pro sklon a F-testem v jednoduchém případě
7. Diagnostika regresního modelu
- Grafická analýza reziduí vs. predikované hodnoty
- Q-Q plot pro ověření normality chybové složky
- Testování heteroskedasticity (Breusch-Paganův test, White test)
- Detekce autokorelace (Durbin-Watsonův test)
- Identifikace vlivných pozorování (leverage, DFFITS, Cookova vzdálenost)
- Předpoklady pro validitu OLS odhadů a důsledky jejich porušení
8. Prognózy a predikční intervaly
- Bodový odhad: $\hat{y}_0 = \hat{\beta}_0 + \hat{\beta}_1 x_0$
- Interval spolehlivosti pro střední hodnotu: $\hat{y}_0 \pm t_{\alpha/2, n-2} \cdot SE(\hat{y}_0)$
- Predikční interval pro nové pozorování (širší než interval spolehlivosti)
- Rozptyl predikce: $Var(\hat{y}_{new}) = \sigma^2 \left[1 + \frac{1}{n} + \frac{(x_0 - \bar{x})^2}{\sum_{i=1}^{n}(x_i - \bar{x})^2}\right]$
- Extrapolace a její rizika
9. Praktické příklady a případové studie
- Analýza vztahu mezi výdaji na vzdělání a budoucími příjmy
- Regrese: tržní cena akcií vs. ziskovost podniku
- Klimatologická data: závislost teploty na nadmořské výšce
- Interpretace výstupů statistických softwarů (R, Python, Stata)
- Kritické posouzení validity modelu v konkrétních aplikacích
10. Rozšíření a limitace
- Transformace proměnných (logaritmické, polynomické modely)
- Vážená nejmenších čtverců (WLS) při heteroskedasticitě
- Robustní regrese jako alternativa za prítomnosti outlierů
- Přechod od jednoduché k vícenásobné regresi
- Omezení lineárního modelu a kdy je vhodné jej aplikovat
Klíčové pojmy
Lineární regresní model
Statistický model vyjadřující lineární závislost mezi závislou proměnnou $Y$ a nezávislou proměnnou $X$ ve tvaru $Y = \beta_0 + \beta_1 X + \varepsilon$, kde $\beta_0$ a $\beta_1$ jsou neznámé parametry a $\varepsilon$ je náhodná chybová složka.
Metoda nejmenších čtverců (OLS)
Estimační procedura minimalizující součet kvadrátů reziduí $\sum_{i=1}^{n}(y_i - \hat{y}_i)^2$. Vedoucí k optimálním nestranným a eficientním odhadům regresních parametrů za platnosti Gauss-Markovových předpokladů (dle věty od Gausse a Markova).
Residuál
Rozdíl mezi pozorovanou hodnotou a hodnotou predikovanou regresním modelem: $e_i = y_i - \hat{y}_i$. Reprezentuje část variability vysvětlenou mimo regresi; měří kvalitu fit modelu.
Koeficient determinace ($R^2$)
Bezrozměrná míra podílu celkové variability závislé proměnné vysvětlené regresním modelem; nabývá hodnot mezi 0 a 1. Vyjádřen jako $R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}$, kde SSR je suma čtverců regrese a SSE suma čtverců reziduí.
Gauss-Markovovy předpoklady
Soubor pěti podmínek nezbytných pro optimalitu OLS odhadů: (1) linearita v parametrech, (2) náhodný výběr, (3) nepřítomnost multikolinearity, (4) nulová střední hodnota chyb ($E[\varepsilon_i|X] = 0$), (5) homoskedasticita a absence autokorelace.
Heteroskedasticita
Porušení předpokladu konstantního rozptylu chybové složky, kdy $Var(\varepsilon_i|X) = \sigma_i^2 \neq \sigma^2$. Vede k neeficientním odhadům a nevalidním standardním chybám, třebaže OLS odhady zůstávají nestranné.
Standardní chyba regresního koeficientu
Odhad směrodatné odchylky distribuce odhadnutého parametru $\hat{\beta}_1$, vypočítaný jako $SE(\hat{\beta}_1) = \sqrt{\frac{\hat{\sigma}^2}{\sum_{i=1}^{n}(x_i - \bar{x})^2}}$. Kritický pro konstruování testů a intervalů spolehlivosti.
Interval spolehlivosti
Intervál, který s danou (např. 95%) pravděpodobností obsahuje skutečnou hodnotu populačního parametru. Pro sklon regrese: $\hat{\beta}_1 \pm t_{\alpha/2, n-2} \cdot SE(\hat{\beta}_1)$.
Predikční interval
Interval pro predikci hodnoty nové individuální jednotky za daných podmínek, širší než interval spolehlivosti. Zahrnuje jak nejistotu odhadu parametrů, tak inherentní variabilitu chybové složky: $\hat{y}_0 \pm t_{\alpha/2, n-2} \cdot SE_{pred}$.
Leverage
Míra vlivu jednotlivého pozorování na odhad regresní přímky na základě vzdálenosti hodnoty $x_i$ od průměru $\bar{x}$. Pozorování s vysokým leverage mají větší potenciál ovlivnit odhady parametrů.
Autokorelace
Porušení předpokladu nezávislosti chybových složek v čase nebo prostoru, kdy $Cov(\varepsilon_i, \varepsilon_j) \neq 0$ pro $i \neq j$. Běžné v časových řadách; vede k neeficientním odhadům a chybným standardním chybám.
ANOVA tabulka v regresi
Tabulka rozkladu variability se sloupci pro součty čtverců (SS), stupně volnosti (df) a průměrné kvadráty (MS). F-statistika $F = \frac{MSR}{MSE}$ testuje globální signifikantnost modelu; v jednoduché regresi je $F = t^2$.