Algorithme d'optimisation iteratif pour minimiser une fonction de cout
réponse
📖 Cours
Le gradient descent est un algorithme qui minimise une fonction en se deplacant dans la direction opposee au gradient.
La descente de gradient avance dans le sens opposé à la pente : si le pas α est assez petit, chaque pas rapproche du creux et se raccourcit à mesure que la pente s'aplatit, alors qu'un pas trop grand éloigne du creux au lieu d'y mener
Algorithme :
Initialiser les parametres θ
Repeter :
θ = θ - α × ∇J(θ)
ou α est le learning rate et ∇J(θ) le gradient de la fonction de cout.
Intuition : le gradient pointe vers la montee la plus raide. On va dans le sens oppose pour descendre.
Exemple 1D : J(θ) = θ², J'(θ) = 2θ
Si θ=4 et α=0.1 : θ_new = 4 - 0.1×8 = 4 - 0.8 = 3.2
Variantes :
Batch GD : utilise tout le dataset a chaque iteration
SGD : utilise un seul exemple a la fois
Mini-batch GD : utilise un sous-ensemble (le plus courant)
Problemes : learning rate trop grand → diverge, trop petit → trop lent.