MSE, cross-entropy et choix de la fonction de cout
réponse
📖 Cours
La fonction de cout (loss function) mesure l'erreur du modele.
Chaque fonction de coût a sa raison d'être : le carré du MSE punit lourdement les grandes erreurs, la valeur absolue du MAE les traite toutes pareil, et l'entropie croisée donne une surface convexe en régression logistique
MSE (Mean Squared Error) - pour la regression :
J = (1/n) Σ (yᵢ - ŷᵢ)²
MAE (Mean Absolute Error) :
J = (1/n) Σ |yᵢ - ŷᵢ|
Cross-Entropy (Binary) - pour la classification :
J = -(1/n) Σ [yᵢ log(ŷᵢ) + (1-yᵢ) log(1-ŷᵢ)]
Pourquoi MSE et pas MAE ? :
MSE est differentiable partout (pratique pour le gradient)
MSE penalise davantage les grandes erreurs
Pourquoi Cross-Entropy et pas MSE pour la classification ? :
La surface de cout est convexe avec cross-entropy en regression logistique (elle ne l'est plus des qu'on ajoute une couche cachee : voir les reseaux de neurones, page 47)
Les gradients sont plus informatifs loin de l'optimum
En pratique : le choix de la loss function influence enormement l'entrainement du modele.