LENET-5 // DOSSIER DOCUMENTAIRE ORIGINAL (1998)
PROJET E26/A60 — DOSSIER PÉDAGOGIQUE

Comprendre les Réseaux de Neurones & LeNet-5

Un guide visuel, progressif et adapté pour comprendre pas à pas le fonctionnement d'un réseau de neurones artificiels et l'architecture historique LeNet-5.

👤 Auteure de référence : Neila Mezghani (2024) 📄 Référence historique : Yann LeCun et al. (1998) 🧩 Format : Concret & Structuré
🧠 Atelier Pratique Interactif dans Google Colab

Testez en direct l'architecture LeNet-5 sur MNIST avec PyTorch, visualisez les filtres convolutifs et observez les 6 animations Remotion intégrées dans votre navigateur.

Open in ColabOpen in Colab Lancer le Notebook

0. Sommaire & Guide de Lecture

Objectif de cette section : Prendre connaissance de la structure du dossier et de la méthode pour l'étudier sereinement.

📌 Comment lire ce dossier (3 conseils simples)

  • Lisez dans l'ordre : Chaque section s'appuie sur la précédente pour une assimilation sans effort.
  • Suivez le fil rouge : Un chiffre « 7 » manuscrit sur un chèque traverse toutes les étapes, de la photo à la décision.
  • Testez à votre rythme : Utilisez les animations et le quiz interactif sans limite de temps.
✦ ✦ ✦

1. Le problème concret : comment une machine lit-elle un chiffre manuscrit ?

Objectif de cette section : Comprendre la différence entre la vision humaine et la vision d'une machine.

D'abord, observons comment un être humain lit un chèque bancaire. Nos yeux reconnaissent instantanément le chiffre « 7 », même s'il est tracé de travers, plus ou moins incliné, avec une barre ou sans barre.

Imaginons qu'une machine regarde ce même chèque.

En réalité, la machine ne voit pas une forme globale. Elle reçoit uniquement une grille de cases appelées pixels. Chaque case contient un simple nombre qui indique le niveau de luminosité : 0 pour une case blanche et 255 pour une case noire avec de l'encre.

Image vue par un humain Numérisation Grille vue par la machine (0 à 255) 250 255 255 240 0 0 0 180 255 0 0 0 255 90 0 0 240 170 0 0 Chaque case est un pixel : 0 = blanc pur, 255 = noir pur (encre)
Figure 1 : L'image d'un « 7 » transformée en grille de nombres pour la machine.

Le défi informatique est alors le suivant : comment enseigner à un programme informatique à reconnaître avec certitude qu'une grille de nombres représente un « 7 », sans écrire des millions de règles manuelles ? C'est la mission exacte d'un réseau de neurones.

Source : [Mezghani, 2024, Chapitre 1 « Fondamentaux de l'apprentissage machine »].

💡 À retenir

  • Une image est une grille de pixels contenant des nombres de luminosité entre 0 et 255.
  • Le réseau doit reconnaître la forme du chiffre malgré toutes les variations d'écriture.
✦ ✦ ✦

2. Le neurone artificiel : une mini-décision élémentaire

Objectif de cette section : Découvrir le bloc fondamental : le neurone et son calcul d'activation.

Imaginons qu'un neurone artificiel soit un juge qui écoute trois témoins. Chaque témoin apporte un indice (une valeur d'entrée). Le juge accorde plus ou moins d'importance à chaque témoin (les poids).

En réalité, la machine effectue deux opérations mathématiques très simples :

  1. La somme pondérée : D'abord, le neurone multiplie chaque entrée par son poids et additionne le tout.
  2. Le test de seuil (fonction d'activation) : Ensuite, si le total dépasse un seuil fixé, le neurone s'allume et envoie un signal (1) ; sinon, il reste éteint (0).
Entrée 1 (Pixel) x₁ Entrée 2 (Pixel) x₂ Entrée 3 (Pixel) x₃ Poids w₁ Poids w₂ Poids w₃ 1. Somme 2. Seuil OUI / 1 Sortie activée
Figure 2 : Schéma fonctionnel du neurone artificiel (Entrées → Somme → Seuil → Sortie).

⚡ Démonstration Interactive : Le Neurone s'active (Entrées → Somme → Seuil → Sortie)

Activez ou désactivez les 3 entrées pour observer le calcul de la somme pondérée et le franchissement du seuil (Seuil fixé à 2.00).

Calcul : (1 × 1.0) + (1 × 1.2) + (0 × 0.5) = 2.20
État du neurone : 🟢 ALLUMÉ — Sortie = 1 (Seuil 2.00 atteint)
Source : [Mezghani, 2024, Chapitre 3 « Réseaux de neurones artificiels », Section 3.1].

💡 À retenir

  • Un neurone calcule une somme pondérée de ses entrées (Entrée × Poids).
  • Si la somme franchit le seuil d'activation, le neurone émet un signal de sortie.
✦ ✦ ✦

3. Le réseau : des couches de neurones qui travaillent en équipe

Objectif de cette section : Comprendre comment l'organisation en couches hiérarchise les décisions.

Imaginons un grand immeuble de bureaux à trois étages. Au rez-de-chaussée, les employés de l'accueil reçoivent le courrier brut. Au premier étage, les gestionnaires trient les dossiers par catégories. Au dernier étage, la direction prend la décision finale.

En réalité, la machine empile des couches de neurones successives :

Organisation en Couches : L'Immeuble à Étages Étage 3 : Couche de Sortie (Décision finale) Émet la classe reconnue parmi les 10 chiffres (0 à 9) « 7 » autre autre Étage 2 : Couche Cachée (Combinaison des traits) Assemble les points en segments (lignes obliques, barres) h₁ h₂ h₃ Étage 1 : Couche d'Entrée (Pixels bruts) Reçoit les valeurs de luminosité de l'image (0 à 255) x₁ x₂ x₃ x₄ L'information monte d'étage en étage : des détails bruts vers la décision globale
Figure 3 : Organisation d'un réseau en couches (Entrée → Couches cachées → Sortie).
Source : [Mezghani, 2024, Chapitre 3 « Réseaux de neurones artificiels », Section 3.3].

💡 À retenir

  • Les neurones sont organisés en couches : couche d'entrée, couches cachées et couche de sortie.
  • Chaque couche apprend des motifs de plus en plus complexes et abstraits.
✦ ✦ ✦

4. L'apprentissage : essai-erreur et correction automatique

Objectif de cette section : Découvrir comment le réseau règle ses poids pour éliminer ses erreurs.

Imaginons un archer débutant qui tire sa première flèche vers une cible. Son premier tir atterrit loin du centre. Il observe l'écart, corrige la position de son bras et recommence.

En réalité, la machine commence avec des poids aléatoires. L'apprentissage se déroule en trois temps répétés des milliers de fois :

  1. D'abord, la prédiction : L'image traverse le réseau vers la sortie.
  2. Ensuite, le calcul de l'erreur : On mesure l'écart entre la réponse fournie et le vrai chiffre « 7 ».
  3. Enfin, la rétropropagation : L'erreur remonte en sens inverse pour ajuster légèrement chaque poids dans la bonne direction.

🏹 La Passerelle Code : De l'Archer au Code PyTorch (Les 5 Verbes Clés)

Pour un débutant, la boucle d'apprentissage d'un réseau de neurones en Python ressemble souvent à une suite d'instructions magiques. En réalité, elle traduit mot pour mot le geste physique d'un archer face à sa cible :

🏹 Geste 0 : Baisser l'arc et vider la mémoire résiduelle optimizer.zero_grad()

Remet les compteurs de correction (gradients) à zéro avant chaque tir pour ne pas cumuler les erreurs du tour précédent.

🏹 Geste 1 : Décocher la flèche (Passe Avant / Forward Pass) outputs = model(images)

L'image de 32×32 pixels traverse tous les étages de l'immeuble (C1 à Sortie) jusqu'au bureau de direction pour émettre une prédiction.

🏹 Geste 2 : Mesurer la distance à la cible (Fonction de Perte / Loss) loss = criterion(outputs, labels)

On calcule l'écart mathématique exact entre le chiffre proposé par le réseau et la cible réelle (l'étiquette du chiffre « 7 »).

🏹 Geste 3 : Rétropropagation — Calcul des angles de correction (Backward) loss.backward()

L'erreur remonte de la sortie vers l'entrée par dérivation en chaîne, calculant le réglage exact nécessaire pour chacun des 61 706 poids.

🏹 Geste 4 : Ajustement effectif de la posture (Mise à jour des poids / Step) optimizer.step()

Tous les poids du réseau sont modifiés d'une infime fraction vers une position plus précise : l'archer est prêt pour un tir plus ajusté au tour suivant !

L'Apprentissage : Diminution de l'Erreur au fil des Tours (Époques) Tour 1 (Début) 90 % Forte erreur Correction Tour 10 (Milieu) 25 % En progrès Ajustement Tour 50 (Terminé) 0.8 % Précision > 99% Rétropropagation : à chaque essai erroné, les 60 000 poids sont légèrement modifiés
Figure 4 : Baisse continue de l'erreur au fil des cycles d'entraînement (époques).

📉 Démonstration Interactive : L'erreur descend au fil de l'apprentissage

Cliquez sur le bouton « Entraîner encore » pour lancer des cycles d'apprentissage, ajuster les poids par rétropropagation et observer la chute de l'erreur.

Cycle d'entraînement (Époque) : 1 / 50 Taux d'erreur de test : 88.5 %
Statut : Les poids sont aléatoires. La machine fait beaucoup d'erreurs.
Source : [Mezghani, 2024, Chapitre 4 « Réseaux de neurones profonds : Défis et solutions », Section 4.2].

💡 À retenir

  • L'apprentissage fonctionne par essai, mesure de l'erreur et correction des poids.
  • La rétropropagation est le mécanisme mathématique qui ajuste les paramètres pour minimiser l'erreur.
✦ ✦ ✦

5. La convolution : la petite fenêtre qui balaye l'image

Objectif de cette section : Comprendre le principe clé des réseaux convolutifs (CNN).

Imaginons une petite loupe carrée transparente (un filtre de 3×3 ou 5×5 pixels) qui glisse pas à pas sur toute la surface de l'image.

En réalité, la machine calcule un produit local entre les pixels sous la loupe et les coefficients du filtre :

Image d'entrée (5x5) Filtre 3×3 Calcul local Carte de traits (3x3) R₁ Le filtre glisse pixel par pixel et détecte les motifs locaux (barres, angles, boucles)
Figure 5 : Principe du filtre glissant de convolution sur une image.

🔍 Démonstration Interactive : « La fenêtre qui balaye » (Grille 6×6)

Observez le filtre 3×3 glisser pas à pas sur l'image 6×6 pour produire la carte de caractéristiques 4×4. Utilisez les boutons ou la lecture lente.

Image d'entrée (6×6)
Carte produite (4×4)
Étape actuelle : 1 / 16 | Position filtre : Ligne 1, Colonne 1 | Valeur calculée : 142
Source : [Mezghani, 2024, Chapitre 5 « Réseaux de neurones convolutifs (CNN) », Section 5.2].

💡 À retenir

  • Un filtre de convolution glisse sur toute l'image pour repérer des formes locales partout où elles apparaissent.
  • Ce procédé réduit le nombre de paramètres nécessaires par rapport à un réseau traditionnel.
✦ ✦ ✦

6. Le pooling : condenser et ne garder que l'essentiel

Objectif de cette section : Découvrir la méthode de compression et d'invariance par sous-échantillonnage.

Imaginons un résumé de réunion qui ne retient que la décision principale de chaque dossier au lieu de toutes les discussions.

En réalité, après avoir détecté les traits avec la convolution, l'image contient encore beaucoup de pixels. Pour rendre le système plus rapide et tolérant aux légers déplacements du dessin, on applique une étape de pooling (ou sous-échantillonnage) :

Zone 2×2 (4 pixels) 12 88 20 45 Max-Pooling (Garder le max) 1 seule case 88 Le pooling divise la taille par 2 en gardant uniquement l'information la plus forte
Figure 6 : Opération de Max-Pooling 2×2 (4 cases réduites à 1 seule case maximale).
Source : [Mezghani, 2024, Chapitre 5 « Réseaux de neurones convolutifs (CNN) », Section 5.2.2].

💡 À retenir

  • Le pooling compresse les dimensions de l'image en sélectionnant les signaux dominants.
  • Il permet au réseau de reconnaître un chiffre même s'il est légèrement déplacé ou déformé.
✦ ✦ ✦

7. LeNet-5 couche par couche : la structure historique complète

Objectif de cette section : Examiner en détail les couches successives de LeNet-5 qui ont fondé la vision moderne.

Conçu en 1998 par l'équipe de Yann LeCun aux laboratoires AT&T Bell, LeNet-5 est le premier réseau convolutif à avoir été déployé à grande échelle industrielle. Le pipeline complet traite une image de 32×32 pixels jusqu'aux 10 sorties de classification (0 à 9).

Architecture LeNet-5 (Yann LeCun et al., 1998) Image 32×32 C1 6 plans 28×28 S2 Pooling 14×14 C3 16 plans 10×10 S4 Pooling 5×5 C5 120 u. Dense F6 84 u. Dense Sortie « 7 » 10 classes Convolution (filtre) Pooling (compression) Dense (décision)
Figure 7 : Pipeline architectural complet de LeNet-5 (de l'entrée 32×32 aux 10 classes de sortie).
🖼️ Entrée (Image 32×32)
Reçoit l'image numérisée et centrée du chiffre manuscrit.
Dimensions : 32×32 | 0 paramètre
🔍 Couche C1 (Convolution 5×5)
Extrait 6 types de traits élémentaires (lignes, angles et bordures).
Sortie : 6 plans 28×28 | 156 paramètres [LeCun et al., 1998, Sect. II-B]
📉 Couche S2 (Sous-échantillonnage 2×2)
Compresse de moitié la résolution pour stabiliser les motifs détectés.
Sortie : 6 plans 14×14 | 12 paramètres [LeCun et al., 1998, Sect. II-B]
🔍 Couche C3 (Convolution 5×5)
Combine les traits simples pour reconnaître des parties complexes de chiffres.
Sortie : 16 plans 10×10 | 1 516 paramètres [LeCun et al., 1998, Sect. II-B]
📉 Couche S4 (Sous-échantillonnage 2×2)
Seconde réduction spatiale pour rendre le modèle robuste aux déformations.
Sortie : 16 plans 5×5 | 32 paramètres [LeCun et al., 1998, Sect. II-B]
🧠 Couche C5 (Convolution dense)
Connecte toutes les caractéristiques spatiales dans 120 unités de décision.
Sortie : 120 unités | 48 120 paramètres [LeCun et al., 1998, Sect. II-B]
🧠 Couche F6 (Couche connectée)
Effectue la synthèse finale des formes pour chaque style d'écriture.
Sortie : 84 unités | 10 164 paramètres [LeCun et al., 1998, Sect. II-B]
🎯 Sortie (10 classes 0 à 9)
Émet la probabilité de chaque chiffre et valide le pic sur le « 7 ».
Sortie : 10 valeurs RBF | 840 paramètres fixes

Au total, LeNet-5 ne compte qu'environ 60 000 paramètres entraînables [LeCun et al., 1998, Sect. II-A « only 60 000 trainable free parameters »]. C'est un cahier de réglages très compact, équivalent à la taille d'un petit livre, là où les modèles d'intelligence artificielle modernes mobilisent des centaines de millions ou des milliards de paramètres.

Source : [LeCun, Bottou, Bengio, Haffner, 1998, « Gradient-Based Learning Applied to Document Recognition », Proceedings of the IEEE, Section II-B].

🏛️ Le Pont 1998 → Moderne : Les Deux Verrous Historiques qui ont Sauté

Si l'architecture de Yann LeCun en 1998 contenait déjà tous les principes fondamentaux du Deep Learning (convolutions, pooling, rétropropagation), pourquoi a-t-il fallu attendre 14 ans (l'avènement d'AlexNet en 2012) pour déclencher la révolution mondiale de l'IA ? Deux verrous majeurs bloquaient le passage à l'échelle :

📉 1. Le Verrou Mathématique : Tanh vs ReLU

En 1998 (Tangente Hyperbolique $\tanh$) : Les neurones utilisaient la fonction $\tanh(z) = \frac{e^z - e^{-z}}{e^z + e^{-z}}$. Dès que l'entrée dépasse $+2$ ou $-2$, la courbe devient quasi horizontale et sa dérivée s'effondre vers zéro ($1 - \tanh^2 \approx 0$). Lors de la rétropropagation, multiplier ces petites dérivées d'étage en étage fait disparaître le gradient ($0.25^N \to 0$, le phénomène du Vanishing Gradient). Les premières couches ne recevaient plus aucun signal d'apprentissage, interdisant d'empiler plus de 5 couches.

🚀 La Solution Moderne (ReLU, 2012) : $\text{ReLU}(z) = \max(0, z)$. Sa dérivée est strictement égale à 1 pour tout $z > 0$. Le signal d'erreur traverse 50 à 1 000 couches (comme dans ResNet) sans aucune atténuation, ouvrant une véritable autoroute pour l'apprentissage profond.
2. Le Verrou Matériel : CPU Séquentiel vs GPU Massif

En 1998 (CPU x86 & DSP AT&T) : Les processeurs Pentium II (300 MHz) traitaient les millions d'opérations de convolution de façon essentiellement séquentielle (un pixel à la fois). Entraîner LeNet-5 nécessitait plusieurs jours de calcul sur stations de travail spécialisées.

🚀 La Solution Moderne (GPU NVIDIA & CUDA) : Détournées des jeux vidéo 3D, les puces graphiques intègrent des milliers de cœurs arithmétiques (ALU) travaillant en parallèle massif (SIMD). Les convolutions sont calculées simultanément sur toute l'image : ce qui prenait des jours en 1998 se calcule en moins de 3 minutes dans un notebook Colab.
💡 Respect scrupuleux de la fidélité historique : Dans notre démonstration officielle et notre notebook Colab, nous conservons rigoureusement les fonctions d'activation nn.Tanh() et le sous-échantillonnage nn.AvgPool2d() de Yann LeCun (1998), garantissant le décompte historique exact de 61 706 paramètres entraînables.

💡 À retenir

  • LeNet-5 alterne Convolution (extraction) et Sous-échantillonnage (compression) avant la décision finale.
  • Le réseau ne compte que 60 000 paramètres, ce qui lui permettait de tourner rapidement sur les processeurs de 1998.
✦ ✦ ✦

8. Résultats concrets et histoire vraie : le tri des chèques NCR

Objectif de cette section : Découvrir l'impact économique réel et les performances mesurées de LeNet-5.

LeNet-5 n'est pas resté confiné dans un laboratoire de recherche théorique. Dès la fin des années 1990, le constructeur bancaire NCR a intégré LeNet-5 dans ses trieuses automatiques de chèques.

BANQUE NATIONALE 7 $ Zone lue Machine NCR Puce DSP + LeNet-5 Millions chèques/mois 7 Chiffre validé Déploiement commercial (depuis juin 1996) : ~20 millions par jour (~10 % du volume US) [LeCun et al., 1998, Sect. III-B]
Figure 8 : Traitement industriel des chèques bancaires par les machines NCR propulsées par LeNet-5.
ANIMATION VIDÉO Figure 8 animée : Démonstration du tri industriel des chèques par LeNet-5
⬇ Télécharger GIF (1.25 Mo)
Figure 8 animée tri chèques NCR
🏦 Processus industriel : Chèque manuscrit ➔ Case montant lue (7 $) ➔ Puce DSP AT&T & LeNet-5 ➔ Chiffre validé & Aiguillage compensation Durée : 5.0s (150 images @ 30 fps) • 1080p Full HD

Les chiffres clés vérifiés de ce déploiement historique sont les suivants :

Sources : [LeCun et al., 1998, Section I « Introduction », Section III « Experiments on MNIST », Sect. II-A-12] & [Wikipédia, LeNet].

💡 À retenir

  • LeNet-5 a prouvé la viabilité industrielle des réseaux convolutifs dès 1998 en traitant ~20 millions de chèques par jour (~10 % du volume US).
  • Son taux d'erreur inférieur à 1% sur MNIST a posé le standard mondial pour la vision par ordinateur.
✦ ✦ ✦

9. À quoi ça sert aujourd'hui : 4 applications du quotidien

Objectif de cette section : Relier les principes de LeNet-5 aux technologies actuelles qui nous entourent.

Les mécanismes inventés avec LeNet-5 (convolution, pooling, couches denses) sont le moteur des systèmes de vision par ordinateur d'aujourd'hui :

📱 1. Déverrouillage par visage (Face ID)

Des réseaux de neurones convolutifs analysent la forme géométrique du visage captée en infrarouge. La machine déverrouille l'appareil instantanément en vérifiant les points clés du visage.

🏥 2. Imagerie médicale (Radiologie)

Les filtres convolutifs repèrent des micro-lésions et anomalies sur les radiographies pulmonaires ou les IRM. Le modèle assiste les médecins en localisant les zones nécessitant un examen approfondi.

🚗 3. Véhicules autonomes

Des caméras embarquées détectent en temps réel les panneaux de signalisation, les piétons et les marquages au sol. Le système ajuste la vitesse et la trajectoire du véhicule pour assurer la sécurité.

🖼️ 4. Tri automatique de photos

Les algorithmes classent automatiquement vos albums selon les scènes visibles (plage, montagne, animaux). Vous retrouvez n'importe quelle photo en tapant un simple mot-clé sans indexation manuelle.

💡 À retenir

  • Toutes les technologies de vision moderne (téléphones, hôpitaux, transports) reposent sur les bases posées par LeNet-5.
  • La combinaison convolution et classification permet d'automatiser des décisions visuelles complexes.
✦ ✦ ✦

10. Glossaire illustré & 10 points clés à retenir

Objectif de cette section : Consolider le vocabulaire technique essentiel et fixer les notions maîtresses.

📖 Glossaire (15 termes indispensables)

Terme technique Définition simple et concrète
PixelPlus petite unité d'une image numérique, représentée par une valeur de luminosité (0 à 255).
Neurone artificielÉlément de calcul effectuant une somme pondérée de ses entrées suivie d'un test de seuil.
Poids synaptique (w)Coefficient numérique ajustable déterminant l'importance accordée à une connexion.
Biais (b)Valeur seuil ajoutée à la somme pondérée pour décaler l'activation d'un neurone.
Fonction d'activationRègle mathématique décidant si le neurone transmet son signal à la couche suivante.
Couche cachéeCouche de neurones intermédiaire située entre la couche d'entrée et la couche de sortie.
ConvolutionOpération de filtrage glissant extrayant des motifs visuels locaux sur une image.
Filtre / NoyauPetite grille de nombres (ex. 3×3 ou 5×5) chargée de détecter un trait spécifique.
Carte de caractéristiquesGrille intermédiaire résultant de l'application d'un filtre de convolution.
Pooling (Sous-échantillonnage)Compression spatiale réduisant la taille de la carte en conservant le signal fort.
RétropropagationAlgorithme qui calcule l'erreur et ajuste chaque poids d'arrière en avant.
Époque (Epoch)Un cycle complet d'entraînement au cours duquel le réseau a vu la totalité des exemples.
Fonction de coût (Loss)Mesure numérique de l'écart d'erreur entre la prédiction et le vrai résultat.
MNISTBase de données de référence historique comportant 70 000 chiffres manuscrits (0 à 9).
Invariance spatialeCapacité d'un réseau à reconnaître un chiffre quel que soit son emplacement dans l'image.

⭐ Les 10 points clés à retenir absolument

  1. Une image est une grille de pixels contenant des valeurs de luminosité de 0 à 255.
  2. Un neurone effectue une somme pondérée de ses entrées et la compare à un seuil d'activation.
  3. Un réseau empile des couches successives pour construire des représentations hiérarchisées.
  4. L'entraînement ajuste automatiquement les poids pour réduire l'erreur par rétropropagation.
  5. La convolution utilise une fenêtre glissante pour repérer les contours et les formes locales.
  6. Le pooling compresse les dimensions et tolère les légères déformations de l'écriture.
  7. LeNet-5 alterne deux blocs Convolution-Pooling avant ses couches denses de décision.
  8. LeNet-5 compte environ 60 000 paramètres entraînables pour classer les chiffres 0 à 9.
  9. LeNet-5 a été validé sur le terrain en traitant des millions de chèques bancaires par mois chez NCR.
  10. Ces principes historiques constituent le socle de toute la vision par ordinateur contemporaine.
✦ ✦ ✦

11. Quiz d'auto-évaluation interactif (10 questions)

Objectif de cette section : Vérifier votre compréhension de façon bienveillante et autonome.

Sélectionnez une réponse pour chaque question. La correction s'affiche immédiatement avec une explication claire.

Question 1 : Comment une machine perçoit-elle une image numérique ?

Question 2 : Quelles sont les deux opérations de base effectuées par un neurone artificiel ?

Question 3 : Dans un réseau de neurones, à quoi servent les « poids » ?

Question 4 : Quel est le rôle principal de l'opération de convolution ?

Question 5 : À quoi sert l'étape de Pooling (Max-Pooling) ?

Question 6 : Combien de paramètres entraînables possède approximativement LeNet-5 (1998) ?

Question 7 : Quelle était l'application commerciale industrielle majeure de LeNet-5 en 1998 ?

Question 8 : Quel taux d'erreur remarquable LeNet-5 a-t-il obtenu sur la base de données MNIST ?

Question 9 : Comment appelle-t-on le mécanisme qui propage l'erreur en arrière pour ajuster les poids ?

Question 10 : Pourquoi les réseaux convolutifs (CNN) sont-ils si performants en vision par ordinateur ?

✦ ✦ ✦