spb/artificial-neural-networks-book Public
Artificial Neural Networks — Methods, Equations and Graphical Representations: a complete book, every method with rigorous equations, pseudocode and native TikZ figures.
TeX 100%
1# CLAUDE.md — Mission : construire un LIVRE LaTeX légendaire sur les réseaux de neurones23> **Amendements utilisateur (2026-08-05)** : format **livre** (parties,4> préface, couverture) plutôt que thèse ; langue **anglaise** ; fichiers de5> chapitres renommés en anglais ; environnements théorème en anglais6> (`theorem`, `property`, `definition`, `remark`).7>8> **Extension majeure (2026-08-05)** : couverture de TOUS les grands types9> de réseaux de neurones, chacun avec équations + **algorithme10> d'estimation** (pseudocode) + figure TikZ, en profondeur maximale.11> Structure finale : **13 chapitres en 5 parties** —12> I. Foundations and Learning (01-foundations, 02-training,13> 03-regularization) ; II. Core Architectures (04-cnn, 05-rnn,14> 06-attention, 07-modern-transformers : ViT/MoE/efficient15> attention/Mamba) ; III. Graphs, Energy and Memory (08-gnn : MPNN/GCN/16> GraphSAGE/GAT/GIN, 09-energy : Hopfield/Boltzmann/RBM/DBN) ;17> IV. Generative Models (10-generative : AE/VAE/GAN, 11-advanced-generative :18> flows/diffusion/autorégressifs) ; V. Specialized and Emerging19> (12-bio-inspired : SNN/SOM/reservoir, 13-emerging : capsules/Neural20> ODE/NTM/KAN). Bibliographie étendue à 36 entrées. Cible : ~120 pages,21> ≥30 figures, ≥150 équations, ≥15 algorithmes.2223> Ce fichier est une **spécification exécutable**. Claude : lis-le en entier,24> puis construis le projet complet décrit ci-dessous dans ce dossier, sans25> demander de confirmation intermédiaire. À la fin, compile et vérifie.2627---2829## 1. Objectif3031Produire un document LaTeX **robuste, complet et élégant** de type thèse,32couvrant en détail toutes les grandes méthodes des réseaux de neurones.33Exigence absolue : **chaque méthode = équations rigoureuses + représentation34graphique TikZ**. Aucune figure externe (pas d'images importées) — tout en35TikZ/pgfplots natif.3637## 2. Métadonnées3839| Champ | Valeur |40|---|---|41| Titre | Artificial Neural Networks — Methods, Equations and Graphical Representations |42| Auteur | **Simon-Pierre Boucher** |43| Contact | **contact@spboucher.ai** (lien `mailto:` cliquable sur la page de titre) |44| Langue | Anglais (babel `english`) |45| Classe | `book`, 11pt, A4 |4647## 3. Structure du projet4849```50these/51├── CLAUDE.md # ce fichier52├── main.tex # préambule, page de titre, résumé, TOC, includes, bibliographie53└── chapters/54 ├── 01-fondations.tex55 ├── 02-entrainement.tex56 ├── 03-regularisation.tex57 ├── 04-cnn.tex58 ├── 05-rnn.tex59 ├── 06-attention.tex60 └── 07-generatifs.tex61```6263## 4. Contenu exigé par chapitre6465### Chapitre 1 — Fondations66- Neurone artificiel : `z = w^T x + b`, `a = φ(z)` ; **figure TikZ** du neurone67 (entrées, poids, somme Σ, activation φ).68- Perceptron de Rosenblatt : règle de mise à jour, théorème de convergence.69- Fonctions d'activation : sigmoïde, tanh, ReLU, Leaky ReLU, GELU — équations70 **et dérivées** ; **courbes pgfplots** superposées.71- Softmax (équation).72- MLP : équations couche par couche `z^(ℓ) = W^(ℓ) a^(ℓ−1) + b^(ℓ)` ;73 **figure TikZ** d'un réseau entièrement connecté à 2 couches cachées.74- Théorème d'approximation universelle (énoncé en environnement `propriete`).7576### Chapitre 2 — Entraînement77- Risque empirique, MSE, entropie croisée ; gradient softmax+CE = `ŷ − y`.78- **Rétropropagation** : les trois équations (δ^(L), récurrence δ^(ℓ),79 gradients W et b) en environnement théorème ; **figure TikZ** du graphe de80 calcul avec passe avant (flèches pleines) et passe arrière (flèches81 pointillées) ; **algorithme** en pseudocode (`algorithm`/`algpseudocode`).82- Optimiseurs : SGD, Momentum, Nesterov, AdaGrad, RMSProp, **Adam complet**83 (avec correction de biais) ; **figure pgfplots** comparant les trajectoires84 SGD vs Momentum sur des contours de perte anisotropes.85- Ordonnancement du taux d'apprentissage (paliers, cosinus, warmup).86- Initialisation Xavier/Glorot et He/Kaiming (formules).8788### Chapitre 3 — Régularisation89- Décomposition biais–variance (équation).90- L2 (weight decay, forme de la mise à jour) et L1.91- **Dropout** : équation inverted dropout ; **figure TikZ** comparant réseau92 complet vs réseau avec neurones désactivés (croix, pointillés).93- **Batch Normalization** : les 4 équations (μ, σ², ẑ, γẑ+β) ; comportement94 à l'inférence. **Layer Normalization** (équation).95- Arrêt précoce (**courbe pgfplots** train vs validation), augmentation de96 données, label smoothing, gradient clipping.9798### Chapitre 4 — CNN99- Convolution : équation avec stride et padding ; formule de dimension de100 sortie ; **figure TikZ en grilles** : entrée 5×5, noyau 3×3 (valeurs101 affichées), sortie 3×3, fenêtre active surlignée.102- Pooling max/moyenne (équations).103- **Figure TikZ** d'une architecture CNN complète (blocs conv/pool de104 hauteurs décroissantes → aplatissement → dense → softmax, avec accolades105 « extraction de caractéristiques » / « classification »).106- **ResNet** : équation `y = F(x) + x`, gradient à travers l'identité ;107 **figure TikZ** du bloc résiduel avec raccourci.108- Champ réceptif (formule récursive).109110### Chapitre 5 — RNN / LSTM / GRU111- RNN simple : équations ; **figure TikZ** forme repliée = forme dépliée.112- BPTT : produit de jacobiennes, gradients évanescents/explosifs.113- **LSTM** : les 6 équations (portes f, i, o, candidat, cellule, sortie) ;114 **figure TikZ détaillée de la cellule** — ligne d'état c_t horizontale en115 haut, portes σ/tanh, opérations × et + explicites. Vérifier visuellement116 qu'aucun nœud ne se chevauche.117- **GRU** : les 4 équations.118- Bidirectionnel, encodeur–décodeur seq2seq (factorisation autorégressive).119120### Chapitre 6 — Attention / Transformers121- Scaled dot-product attention (équation matricielle) + justification du122 facteur 1/√d_k (argument de variance) ; **figure TikZ** du flux123 Q,K,V → QKᵀ → ÷√d_k → softmax → ×V.124- Multi-têtes (équations head_i et concat·W^O).125- Encodage positionnel sinusoïdal (les deux équations).126- Bloc Transformer : Add&LayerNorm, FFN ; masque causal ; **grande figure127 TikZ** de l'architecture encodeur–décodeur complète (deux colonnes,128 connexions résiduelles, flèche K,V encodeur → attention croisée, ×N).129- Complexité O(n²d) ; familles BERT / GPT / T5.130131### Chapitre 7 — Modèles génératifs132- Auto-encodeur : équations + **figure TikZ** en sablier (goulot latent).133- **VAE** : ELBO (avec accolades « reconstruction » / « régularisation »),134 KL en forme close pour gaussiennes diagonales, **reparamétrisation** ;135 **figure TikZ** du flux x → encodeur → (μ, σ) → z = μ+σ⊙ε → décodeur.136- **GAN** : jeu minimax, discriminateur optimal D*, lien avec la divergence137 de Jensen–Shannon, perte non saturante, WGAN ; **figure TikZ**138 générateur/discriminateur avec gradient adverse en pointillés.139- **Tableau comparatif** (booktabs) VAE / GAN / autorégressif.140- Ouverture sur les modèles de diffusion (équation du bruitage).141142## 5. Conventions techniques (obligatoires)143144- **Préambule** : `inputenc utf8`, `fontenc T1`, `babel french`, `lmodern`,145 `microtype`, `amsmath amssymb amsthm mathtools bm`, `tikz` (libraries :146 `positioning, arrows.meta, calc, shapes.geometric, fit, backgrounds,147 decorations.pathreplacing`), `pgfplots` (`compat=1.17`), `algorithm` +148 `algpseudocode`, `geometry`, `fancyhdr`, `booktabs`, `hyperref` (liens149 colorés).150- **Macros** : `\vect{x}` (vecteur gras via `\bm`), `\mat{W}`, `\Loss`,151 `\E`, `\R`, `\softmax`, `\argmin`, `\argmax`. Notation cohérente partout ;152 produit de Hadamard `\odot`.153- **Styles TikZ globaux** dans `main.tex` : `neuron`, `ninput` (bleu),154 `nhidden` (orange), `noutput` (rouge), `bloc`, `fleche` (Stealth), `op` ;155 palette nommée : `cinput` bleu, `chidden` orange, `coutput` rouge,156 `cgate` vert, `cmem` violet. **Toutes** les figures réutilisent ces styles.157- **Environnements théorème** : `definition`, `remarque`, `propriete`158 numérotés par chapitre.159- Toute équation référencée porte un `\label{eq:...}` et est citée par160 `\eqref`. Toute figure : `figure` + `\caption` + `\label{fig:...}`.161- **Page de titre** : titre, sous-titre, mini-réseau TikZ décoratif, auteur162 en italique, e-mail cliquable, date.163- **Résumé** + mots-clés avant la table des matières.164- **Bibliographie** `thebibliography` inline dans `main.tex` (pas de bibtex) :165 Rosenblatt 1958, Rumelhart 1986, LeCun 1998, Hochreiter 1997, Cho 2014,166 Srivastava 2014, Ioffe 2015, Kingma & Ba 2015, He 2016, Vaswani 2017,167 Kingma & Welling 2014, Goodfellow 2014, Goodfellow et al. (livre) 2016 —168 toutes citées au moins une fois dans le texte.169170## 6. Construction et vérification (workflow imposé)1711721. Vérifier les dépendances TeX (TeX Live complet requis : pgf/pgfplots,173 babel-french, algorithms).1742. Créer `main.tex` puis chaque chapitre.1753. Compiler : `pdflatex -interaction=nonstopmode main.tex` **deux fois**176 (TOC + références croisées).1774. **Zéro tolérance** : aucune erreur `!`, aucune `Undefined reference`,178 aucune citation non résolue. Corriger et recompiler jusqu'à propreté.1795. **Contrôle visuel obligatoire** : rasteriser les pages contenant les180 figures complexes (`pdftoppm -png`) et inspecter au minimum : page de181 titre, cellule LSTM, architecture Transformer, convolution en grilles.182 Corriger tout chevauchement de nœuds ou flèche mal routée, puis183 recompiler.1846. Nettoyer les artefacts (`.aux`, `.log`, `.out`, `.toc`, PNG de contrôle).1857. Livrer : `main.pdf` + le dossier source complet (zip).186187## 7. Critères de « légendaire »188189- ~25 pages ou plus, densité soutenue mais lisible.190- Au moins **12 figures TikZ/pgfplots** et **50 équations numérotées**.191- Cohérence de notation absolue d'un chapitre à l'autre.192- Chaque affirmation non triviale adossée à une équation, une figure ou une193 référence bibliographique.194- Le document doit pouvoir servir de support de cours autonome.195