Un réseau de neurones artificiel est inspiré du cerveau : des unités simples (neurones) sont connectées en couches et calculent une sortie à partir d'une entrée.
1. Le neurone artificiel
Un neurone fait deux choses :
Combinaison linéaire des entrées : z = w₁x₁ + w₂x₂ + … + b (les wᵢ sont les poids, b est le biais).
Fonction d'activation non linéaire : a = f(z)
Fonctions d'activation courantes :
ReLU : f(z) = max(0, z) — la plus utilisée
Sigmoid : f(z) = 1 / (1 + e⁻ᶻ) — sortie entre 0 et 1
Tanh : sortie entre −1 et 1
Softmax : pour classifier en plusieurs catégories
2. Architecture en couches
Couche d'entrée : reçoit les données brutes
Couches cachées : transforment les données (1 à des milliers de couches)
Couche de sortie : donne la prédiction
Les trois étages d'un réseau de neurones : la couche d'entrée reçoit les données brutes, les couches cachées les transforment, la couche de sortie donne la prédiction
Deep learning = réseau avec plusieurs couches cachées (généralement > 3).
3. Apprentissage : la rétropropagation
On donne une donnée au réseau → il prédit une sortie.
On compare avec la vraie valeur → on calcule une erreur (loss).
On propage l'erreur en arrière pour ajuster chaque poids.
On répète sur des milliers/millions d'exemples.
L'optimisation utilise la descente de gradient (cf. cours maths jour 28).
4. Types de réseaux
MLP (Multi-Layer Perceptron) : le plus simple, fully connected