# CLAUDE.md — Mission : construire un LIVRE LaTeX légendaire sur les réseaux de neurones > **Amendements utilisateur (2026-08-05)** : format **livre** (parties, > préface, couverture) plutôt que thèse ; langue **anglaise** ; fichiers de > chapitres renommés en anglais ; environnements théorème en anglais > (`theorem`, `property`, `definition`, `remark`). > > **Extension majeure (2026-08-05)** : couverture de TOUS les grands types > de réseaux de neurones, chacun avec équations + **algorithme > d'estimation** (pseudocode) + figure TikZ, en profondeur maximale. > Structure finale : **13 chapitres en 5 parties** — > I. Foundations and Learning (01-foundations, 02-training, > 03-regularization) ; II. Core Architectures (04-cnn, 05-rnn, > 06-attention, 07-modern-transformers : ViT/MoE/efficient > attention/Mamba) ; III. Graphs, Energy and Memory (08-gnn : MPNN/GCN/ > GraphSAGE/GAT/GIN, 09-energy : Hopfield/Boltzmann/RBM/DBN) ; > IV. Generative Models (10-generative : AE/VAE/GAN, 11-advanced-generative : > flows/diffusion/autorégressifs) ; V. Specialized and Emerging > (12-bio-inspired : SNN/SOM/reservoir, 13-emerging : capsules/Neural > ODE/NTM/KAN). Bibliographie étendue à 36 entrées. Cible : ~120 pages, > ≥30 figures, ≥150 équations, ≥15 algorithmes. > Ce fichier est une **spécification exécutable**. Claude : lis-le en entier, > puis construis le projet complet décrit ci-dessous dans ce dossier, sans > demander de confirmation intermédiaire. À la fin, compile et vérifie. --- ## 1. Objectif Produire un document LaTeX **robuste, complet et élégant** de type thèse, couvrant en détail toutes les grandes méthodes des réseaux de neurones. Exigence absolue : **chaque méthode = équations rigoureuses + représentation graphique TikZ**. Aucune figure externe (pas d'images importées) — tout en TikZ/pgfplots natif. ## 2. Métadonnées | Champ | Valeur | |---|---| | Titre | Artificial Neural Networks — Methods, Equations and Graphical Representations | | Auteur | **Simon-Pierre Boucher** | | Contact | **contact@spboucher.ai** (lien `mailto:` cliquable sur la page de titre) | | Langue | Anglais (babel `english`) | | Classe | `book`, 11pt, A4 | ## 3. Structure du projet ``` these/ ├── CLAUDE.md # ce fichier ├── main.tex # préambule, page de titre, résumé, TOC, includes, bibliographie └── chapters/ ├── 01-fondations.tex ├── 02-entrainement.tex ├── 03-regularisation.tex ├── 04-cnn.tex ├── 05-rnn.tex ├── 06-attention.tex └── 07-generatifs.tex ``` ## 4. Contenu exigé par chapitre ### Chapitre 1 — Fondations - Neurone artificiel : `z = w^T x + b`, `a = φ(z)` ; **figure TikZ** du neurone (entrées, poids, somme Σ, activation φ). - Perceptron de Rosenblatt : règle de mise à jour, théorème de convergence. - Fonctions d'activation : sigmoïde, tanh, ReLU, Leaky ReLU, GELU — équations **et dérivées** ; **courbes pgfplots** superposées. - Softmax (équation). - MLP : équations couche par couche `z^(ℓ) = W^(ℓ) a^(ℓ−1) + b^(ℓ)` ; **figure TikZ** d'un réseau entièrement connecté à 2 couches cachées. - Théorème d'approximation universelle (énoncé en environnement `propriete`). ### Chapitre 2 — Entraînement - Risque empirique, MSE, entropie croisée ; gradient softmax+CE = `ŷ − y`. - **Rétropropagation** : les trois équations (δ^(L), récurrence δ^(ℓ), gradients W et b) en environnement théorème ; **figure TikZ** du graphe de calcul avec passe avant (flèches pleines) et passe arrière (flèches pointillées) ; **algorithme** en pseudocode (`algorithm`/`algpseudocode`). - Optimiseurs : SGD, Momentum, Nesterov, AdaGrad, RMSProp, **Adam complet** (avec correction de biais) ; **figure pgfplots** comparant les trajectoires SGD vs Momentum sur des contours de perte anisotropes. - Ordonnancement du taux d'apprentissage (paliers, cosinus, warmup). - Initialisation Xavier/Glorot et He/Kaiming (formules). ### Chapitre 3 — Régularisation - Décomposition biais–variance (équation). - L2 (weight decay, forme de la mise à jour) et L1. - **Dropout** : équation inverted dropout ; **figure TikZ** comparant réseau complet vs réseau avec neurones désactivés (croix, pointillés). - **Batch Normalization** : les 4 équations (μ, σ², ẑ, γẑ+β) ; comportement à l'inférence. **Layer Normalization** (équation). - Arrêt précoce (**courbe pgfplots** train vs validation), augmentation de données, label smoothing, gradient clipping. ### Chapitre 4 — CNN - Convolution : équation avec stride et padding ; formule de dimension de sortie ; **figure TikZ en grilles** : entrée 5×5, noyau 3×3 (valeurs affichées), sortie 3×3, fenêtre active surlignée. - Pooling max/moyenne (équations). - **Figure TikZ** d'une architecture CNN complète (blocs conv/pool de hauteurs décroissantes → aplatissement → dense → softmax, avec accolades « extraction de caractéristiques » / « classification »). - **ResNet** : équation `y = F(x) + x`, gradient à travers l'identité ; **figure TikZ** du bloc résiduel avec raccourci. - Champ réceptif (formule récursive). ### Chapitre 5 — RNN / LSTM / GRU - RNN simple : équations ; **figure TikZ** forme repliée = forme dépliée. - BPTT : produit de jacobiennes, gradients évanescents/explosifs. - **LSTM** : les 6 équations (portes f, i, o, candidat, cellule, sortie) ; **figure TikZ détaillée de la cellule** — ligne d'état c_t horizontale en haut, portes σ/tanh, opérations × et + explicites. Vérifier visuellement qu'aucun nœud ne se chevauche. - **GRU** : les 4 équations. - Bidirectionnel, encodeur–décodeur seq2seq (factorisation autorégressive). ### Chapitre 6 — Attention / Transformers - Scaled dot-product attention (équation matricielle) + justification du facteur 1/√d_k (argument de variance) ; **figure TikZ** du flux Q,K,V → QKᵀ → ÷√d_k → softmax → ×V. - Multi-têtes (équations head_i et concat·W^O). - Encodage positionnel sinusoïdal (les deux équations). - Bloc Transformer : Add&LayerNorm, FFN ; masque causal ; **grande figure TikZ** de l'architecture encodeur–décodeur complète (deux colonnes, connexions résiduelles, flèche K,V encodeur → attention croisée, ×N). - Complexité O(n²d) ; familles BERT / GPT / T5. ### Chapitre 7 — Modèles génératifs - Auto-encodeur : équations + **figure TikZ** en sablier (goulot latent). - **VAE** : ELBO (avec accolades « reconstruction » / « régularisation »), KL en forme close pour gaussiennes diagonales, **reparamétrisation** ; **figure TikZ** du flux x → encodeur → (μ, σ) → z = μ+σ⊙ε → décodeur. - **GAN** : jeu minimax, discriminateur optimal D*, lien avec la divergence de Jensen–Shannon, perte non saturante, WGAN ; **figure TikZ** générateur/discriminateur avec gradient adverse en pointillés. - **Tableau comparatif** (booktabs) VAE / GAN / autorégressif. - Ouverture sur les modèles de diffusion (équation du bruitage). ## 5. Conventions techniques (obligatoires) - **Préambule** : `inputenc utf8`, `fontenc T1`, `babel french`, `lmodern`, `microtype`, `amsmath amssymb amsthm mathtools bm`, `tikz` (libraries : `positioning, arrows.meta, calc, shapes.geometric, fit, backgrounds, decorations.pathreplacing`), `pgfplots` (`compat=1.17`), `algorithm` + `algpseudocode`, `geometry`, `fancyhdr`, `booktabs`, `hyperref` (liens colorés). - **Macros** : `\vect{x}` (vecteur gras via `\bm`), `\mat{W}`, `\Loss`, `\E`, `\R`, `\softmax`, `\argmin`, `\argmax`. Notation cohérente partout ; produit de Hadamard `\odot`. - **Styles TikZ globaux** dans `main.tex` : `neuron`, `ninput` (bleu), `nhidden` (orange), `noutput` (rouge), `bloc`, `fleche` (Stealth), `op` ; palette nommée : `cinput` bleu, `chidden` orange, `coutput` rouge, `cgate` vert, `cmem` violet. **Toutes** les figures réutilisent ces styles. - **Environnements théorème** : `definition`, `remarque`, `propriete` numérotés par chapitre. - Toute équation référencée porte un `\label{eq:...}` et est citée par `\eqref`. Toute figure : `figure` + `\caption` + `\label{fig:...}`. - **Page de titre** : titre, sous-titre, mini-réseau TikZ décoratif, auteur en italique, e-mail cliquable, date. - **Résumé** + mots-clés avant la table des matières. - **Bibliographie** `thebibliography` inline dans `main.tex` (pas de bibtex) : Rosenblatt 1958, Rumelhart 1986, LeCun 1998, Hochreiter 1997, Cho 2014, Srivastava 2014, Ioffe 2015, Kingma & Ba 2015, He 2016, Vaswani 2017, Kingma & Welling 2014, Goodfellow 2014, Goodfellow et al. (livre) 2016 — toutes citées au moins une fois dans le texte. ## 6. Construction et vérification (workflow imposé) 1. Vérifier les dépendances TeX (TeX Live complet requis : pgf/pgfplots, babel-french, algorithms). 2. Créer `main.tex` puis chaque chapitre. 3. Compiler : `pdflatex -interaction=nonstopmode main.tex` **deux fois** (TOC + références croisées). 4. **Zéro tolérance** : aucune erreur `!`, aucune `Undefined reference`, aucune citation non résolue. Corriger et recompiler jusqu'à propreté. 5. **Contrôle visuel obligatoire** : rasteriser les pages contenant les figures complexes (`pdftoppm -png`) et inspecter au minimum : page de titre, cellule LSTM, architecture Transformer, convolution en grilles. Corriger tout chevauchement de nœuds ou flèche mal routée, puis recompiler. 6. Nettoyer les artefacts (`.aux`, `.log`, `.out`, `.toc`, PNG de contrôle). 7. Livrer : `main.pdf` + le dossier source complet (zip). ## 7. Critères de « légendaire » - ~25 pages ou plus, densité soutenue mais lisible. - Au moins **12 figures TikZ/pgfplots** et **50 équations numérotées**. - Cohérence de notation absolue d'un chapitre à l'autre. - Chaque affirmation non triviale adossée à une équation, une figure ou une référence bibliographique. - Le document doit pouvoir servir de support de cours autonome.