La regularisation ajoute un terme de penalite a la fonction de cout pour empecher le surapprentissage (overfitting).
Le coefficient de régularisation est un curseur entre deux fautes : à zéro le modèle épouse le bruit, trop grand il devient trop simple, et le bon réglage se cherche par validation croisée
L2 (Ridge) : J_reg = J + λ Σ θᵢ²
Penalise les grands coefficients
Les coefficients tendent vers 0 mais n'atteignent jamais 0
Equivalent a une prior gaussienne en bayesien
L1 (Lasso) : J_reg = J + λ Σ |θᵢ|
Penalise la valeur absolue des coefficients
Certains coefficients deviennent exactement 0 → selection de features
Equivalent a une prior laplacienne
Elastic Net : combine L1 et L2 :
J_reg = J + λ₁ Σ |θᵢ| + λ₂ Σ θᵢ²
Hyperparametre λ :
λ = 0 : pas de regularisation
λ grand : forte regularisation (modele simple, risque de underfitting)