SPB Git

spb/artificial-neural-networks-book Public

Artificial Neural Networks — Methods, Equations and Graphical Representations: a complete book, every method with rigorous equations, pseudocode and native TikZ figures.

TeX 100%

# CLAUDE.md — Mission : construire un LIVRE LaTeX légendaire sur les réseaux de neurones

Amendements utilisateur (2026-08-05) : format livre (parties, préface, couverture) plutôt que thèse ; langue anglaise ; fichiers de chapitres renommés en anglais ; environnements théorème en anglais (theorem, property, definition, remark).

Extension majeure (2026-08-05) : couverture de TOUS les grands types de réseaux de neurones, chacun avec équations + algorithme d'estimation (pseudocode) + figure TikZ, en profondeur maximale. Structure finale : 13 chapitres en 5 parties — I. Foundations and Learning (01-foundations, 02-training, 03-regularization) ; II. Core Architectures (04-cnn, 05-rnn, 06-attention, 07-modern-transformers : ViT/MoE/efficient attention/Mamba) ; III. Graphs, Energy and Memory (08-gnn : MPNN/GCN/ GraphSAGE/GAT/GIN, 09-energy : Hopfield/Boltzmann/RBM/DBN) ; IV. Generative Models (10-generative : AE/VAE/GAN, 11-advanced-generative : flows/diffusion/autorégressifs) ; V. Specialized and Emerging (12-bio-inspired : SNN/SOM/reservoir, 13-emerging : capsules/Neural ODE/NTM/KAN). Bibliographie étendue à 36 entrées. Cible : ~120 pages, ≥30 figures, ≥150 équations, ≥15 algorithmes.

Ce fichier est une spécification exécutable. Claude : lis-le en entier, puis construis le projet complet décrit ci-dessous dans ce dossier, sans demander de confirmation intermédiaire. À la fin, compile et vérifie.


# 1. Objectif

Produire un document LaTeX robuste, complet et élégant de type thèse, couvrant en détail toutes les grandes méthodes des réseaux de neurones. Exigence absolue : chaque méthode = équations rigoureuses + représentation graphique TikZ. Aucune figure externe (pas d'images importées) — tout en TikZ/pgfplots natif.

# 2. Métadonnées

Champ Valeur
Titre Artificial Neural Networks — Methods, Equations and Graphical Representations
Auteur Simon-Pierre Boucher
Contact contact@spboucher.ai (lien mailto: cliquable sur la page de titre)
Langue Anglais (babel english)
Classe book, 11pt, A4

# 3. Structure du projet

text
these/
├── CLAUDE.md                      # ce fichier
├── main.tex                       # préambule, page de titre, résumé, TOC, includes, bibliographie
└── chapters/
    ├── 01-fondations.tex
    ├── 02-entrainement.tex
    ├── 03-regularisation.tex
    ├── 04-cnn.tex
    ├── 05-rnn.tex
    ├── 06-attention.tex
    └── 07-generatifs.tex

# 4. Contenu exigé par chapitre

# Chapitre 1 — Fondations

  • Neurone artificiel : z = w^T x + b, a = φ(z) ; figure TikZ du neurone (entrées, poids, somme Σ, activation φ).
  • Perceptron de Rosenblatt : règle de mise à jour, théorème de convergence.
  • Fonctions d'activation : sigmoïde, tanh, ReLU, Leaky ReLU, GELU — équations et dérivées ; courbes pgfplots superposées.
  • Softmax (équation).
  • MLP : équations couche par couche z^(ℓ) = W^(ℓ) a^(ℓ−1) + b^(ℓ) ; figure TikZ d'un réseau entièrement connecté à 2 couches cachées.
  • Théorème d'approximation universelle (énoncé en environnement propriete).

# Chapitre 2 — Entraînement

  • Risque empirique, MSE, entropie croisée ; gradient softmax+CE = ŷ − y.
  • Rétropropagation : les trois équations (δ^(L), récurrence δ^(ℓ), gradients W et b) en environnement théorème ; figure TikZ du graphe de calcul avec passe avant (flèches pleines) et passe arrière (flèches pointillées) ; algorithme en pseudocode (algorithm/algpseudocode).
  • Optimiseurs : SGD, Momentum, Nesterov, AdaGrad, RMSProp, Adam complet (avec correction de biais) ; figure pgfplots comparant les trajectoires SGD vs Momentum sur des contours de perte anisotropes.
  • Ordonnancement du taux d'apprentissage (paliers, cosinus, warmup).
  • Initialisation Xavier/Glorot et He/Kaiming (formules).

# Chapitre 3 — Régularisation

  • Décomposition biais–variance (équation).
  • L2 (weight decay, forme de la mise à jour) et L1.
  • Dropout : équation inverted dropout ; figure TikZ comparant réseau complet vs réseau avec neurones désactivés (croix, pointillés).
  • Batch Normalization : les 4 équations (μ, σ², ẑ, γẑ+β) ; comportement à l'inférence. Layer Normalization (équation).
  • Arrêt précoce (courbe pgfplots train vs validation), augmentation de données, label smoothing, gradient clipping.

# Chapitre 4 — CNN

  • Convolution : équation avec stride et padding ; formule de dimension de sortie ; figure TikZ en grilles : entrée 5×5, noyau 3×3 (valeurs affichées), sortie 3×3, fenêtre active surlignée.
  • Pooling max/moyenne (équations).
  • Figure TikZ d'une architecture CNN complète (blocs conv/pool de hauteurs décroissantes → aplatissement → dense → softmax, avec accolades « extraction de caractéristiques » / « classification »).
  • ResNet : équation y = F(x) + x, gradient à travers l'identité ; figure TikZ du bloc résiduel avec raccourci.
  • Champ réceptif (formule récursive).

# Chapitre 5 — RNN / LSTM / GRU

  • RNN simple : équations ; figure TikZ forme repliée = forme dépliée.
  • BPTT : produit de jacobiennes, gradients évanescents/explosifs.
  • LSTM : les 6 équations (portes f, i, o, candidat, cellule, sortie) ; figure TikZ détaillée de la cellule — ligne d'état c_t horizontale en haut, portes σ/tanh, opérations × et + explicites. Vérifier visuellement qu'aucun nœud ne se chevauche.
  • GRU : les 4 équations.
  • Bidirectionnel, encodeur–décodeur seq2seq (factorisation autorégressive).

# Chapitre 6 — Attention / Transformers

  • Scaled dot-product attention (équation matricielle) + justification du facteur 1/√d_k (argument de variance) ; figure TikZ du flux Q,K,V → QKᵀ → ÷√d_k → softmax → ×V.
  • Multi-têtes (équations head_i et concat·W^O).
  • Encodage positionnel sinusoïdal (les deux équations).
  • Bloc Transformer : Add&LayerNorm, FFN ; masque causal ; grande figure TikZ de l'architecture encodeur–décodeur complète (deux colonnes, connexions résiduelles, flèche K,V encodeur → attention croisée, ×N).
  • Complexité O(n²d) ; familles BERT / GPT / T5.

# Chapitre 7 — Modèles génératifs

  • Auto-encodeur : équations + figure TikZ en sablier (goulot latent).
  • VAE : ELBO (avec accolades « reconstruction » / « régularisation »), KL en forme close pour gaussiennes diagonales, reparamétrisation ; figure TikZ du flux x → encodeur → (μ, σ) → z = μ+σ⊙ε → décodeur.
  • GAN : jeu minimax, discriminateur optimal D*, lien avec la divergence de Jensen–Shannon, perte non saturante, WGAN ; figure TikZ générateur/discriminateur avec gradient adverse en pointillés.
  • Tableau comparatif (booktabs) VAE / GAN / autorégressif.
  • Ouverture sur les modèles de diffusion (équation du bruitage).

# 5. Conventions techniques (obligatoires)

  • Préambule : inputenc utf8, fontenc T1, babel french, lmodern, microtype, amsmath amssymb amsthm mathtools bm, tikz (libraries : positioning, arrows.meta, calc, shapes.geometric, fit, backgrounds, decorations.pathreplacing), pgfplots (compat=1.17), algorithm + algpseudocode, geometry, fancyhdr, booktabs, hyperref (liens colorés).
  • Macros : \vect{x} (vecteur gras via \bm), \mat{W}, \Loss, \E, \R, \softmax, \argmin, \argmax. Notation cohérente partout ; produit de Hadamard \odot.
  • Styles TikZ globaux dans main.tex : neuron, ninput (bleu), nhidden (orange), noutput (rouge), bloc, fleche (Stealth), op ; palette nommée : cinput bleu, chidden orange, coutput rouge, cgate vert, cmem violet. Toutes les figures réutilisent ces styles.
  • Environnements théorème : definition, remarque, propriete numérotés par chapitre.
  • Toute équation référencée porte un \label{eq:...} et est citée par \eqref. Toute figure : figure + \caption + \label{fig:...}.
  • Page de titre : titre, sous-titre, mini-réseau TikZ décoratif, auteur en italique, e-mail cliquable, date.
  • Résumé + mots-clés avant la table des matières.
  • Bibliographie thebibliography inline dans main.tex (pas de bibtex) : Rosenblatt 1958, Rumelhart 1986, LeCun 1998, Hochreiter 1997, Cho 2014, Srivastava 2014, Ioffe 2015, Kingma & Ba 2015, He 2016, Vaswani 2017, Kingma & Welling 2014, Goodfellow 2014, Goodfellow et al. (livre) 2016 — toutes citées au moins une fois dans le texte.

# 6. Construction et vérification (workflow imposé)

  1. Vérifier les dépendances TeX (TeX Live complet requis : pgf/pgfplots, babel-french, algorithms).
  2. Créer main.tex puis chaque chapitre.
  3. Compiler : pdflatex -interaction=nonstopmode main.tex deux fois (TOC + références croisées).
  4. Zéro tolérance : aucune erreur !, aucune Undefined reference, aucune citation non résolue. Corriger et recompiler jusqu'à propreté.
  5. Contrôle visuel obligatoire : rasteriser les pages contenant les figures complexes (pdftoppm -png) et inspecter au minimum : page de titre, cellule LSTM, architecture Transformer, convolution en grilles. Corriger tout chevauchement de nœuds ou flèche mal routée, puis recompiler.
  6. Nettoyer les artefacts (.aux, .log, .out, .toc, PNG de contrôle).
  7. Livrer : main.pdf + le dossier source complet (zip).

# 7. Critères de « légendaire »

  • ~25 pages ou plus, densité soutenue mais lisible.
  • Au moins 12 figures TikZ/pgfplots et 50 équations numérotées.
  • Cohérence de notation absolue d'un chapitre à l'autre.
  • Chaque affirmation non triviale adossée à une équation, une figure ou une référence bibliographique.
  • Le document doit pouvoir servir de support de cours autonome.