Avant de se perdre dans les sorties de la semaine, voyons d'où on part. Quatre-vingts ans en sept époques : les deux premières occupent 57 ans, les cinq suivantes tiennent en 15. Faites défiler, le temps avance avec vous.
Les fondations
- 1943
Le neurone formel (McCulloch et Pitts)
Un neurone devient un interrupteur mathématique à seuil. Il ne sait rien apprendre, mais la brique est posée.
- 1950
Turing pose la question : une machine peut-elle penser ?
Son article propose le jeu de l'imitation, qu'on appellera le test de Turing.
- 1956
Conférence de Dartmouth
McCarthy y invente le terme « intelligence artificielle ». C'est la naissance officielle de la discipline.
- 1958
Le perceptron (Rosenblatt)
Première machine qui ajuste ses poids à partir d'exemples. Elle fonctionne, mais seulement sur les problèmes linéairement séparables.
- 1969
Minsky et Papert publient Perceptrons
Ils démontrent qu'un perceptron simple ne peut pas apprendre le XOR. Les financements s'effondrent : premier hiver de l'IA, dans les années 1970.
La traversée du désert
- Années 1980
Les systèmes experts
Une IA à base de règles écrites à la main. Le boom commercial est suivi d'un deuxième hiver, vers 1987-1993.
- 1986
La rétropropagation (Rumelhart, Hinton, Williams)
L'erreur remonte de la sortie vers les couches profondes pour corriger chaque poids. L'idée existait chez Linnainmaa (1970) et Werbos (1974) ; cet article la rend utilisable.
- 1989 à 1998
Les réseaux convolutifs (LeCun, LeNet)
Ils lisent des codes postaux puis des chèques. L'architecture de la vision moderne existe déjà ; il lui manque les données et la puissance de calcul.
- 1997
LSTM, et Deep Blue bat Kasparov
Le LSTM (Hochreiter et Schmidhuber) donne une mémoire aux réseaux récurrents et dominera le langage pendant vingt ans. Deep Blue relève de la recherche brute, pas de l'apprentissage.
- 2006
Hinton relance les réseaux profonds
Ses deep belief networks popularisent le terme « deep learning », qui date en réalité de 1986.
- 2009
ImageNet (Fei-Fei Li)
Des millions d'images étiquetées. C'est le carburant qui manquait.
Le deep learning s'impose
- 2012
AlexNet
Un réseau convolutif de 8 couches, entraîné sur deux GPU grand public, gagne ImageNet avec 15,3 % d'erreur contre 26,2 % pour le deuxième. L'écart est tel que tout le domaine bascule en deux ans.
- 2013
word2vec (Mikolov)
Les mots deviennent des vecteurs, et le sens devient de la géométrie.
- 2014
GAN, seq2seq et attention
Goodfellow invente les GAN, où un faussaire affronte un détecteur. Bahdanau introduit le mécanisme d'attention pour la traduction : c'est lui, pas le transformer, qui invente l'attention.
- 2015
ResNet
152 couches grâce aux connexions résiduelles, 3,57 % d'erreur sur ImageNet. Le niveau humain (environ 5 %) est dépassé.
- 2016
AlphaGo bat Lee Sedol 4-1
L'apprentissage par renforcement combiné aux réseaux profonds l'emporte, dix ans avant ce que prévoyaient les experts du go.
L'ère du transformer
- 2017
« Attention Is All You Need » (Google)
Plus de récurrence, seulement de l'attention : toute la séquence est traitée en parallèle, ce qui rend l'entraînement massivement parallélisable sur GPU. La contrepartie est un coût quadratique avec la longueur du contexte, origine de toutes les batailles autour du cache KV. La même année : le MoE moderne (Shazeer) et le RLHF (Christiano).
- 2018
GPT-1 et BERT
Même brique, deux exercices. GPT prédit le mot suivant, de gauche à droite. BERT devine des mots masqués en lisant dans les deux sens. BERT domine d'abord ; c'est la voie GPT qui finira par gagner.
- 2019
GPT-2
1,5 milliard de paramètres, premier modèle jugé « trop dangereux » pour être publié d'un coup.
- 2020
GPT-3, les lois d'échelle, la diffusion, AlphaFold 2
GPT-3 (175 milliards de paramètres) apprend une tâche à partir de quelques exemples dans le prompt. Kaplan formalise les lois d'échelle. Les modèles de diffusion (DDPM) détrôneront les GAN. AlphaFold 2 résout le repliement des protéines.
- 2021
Codex, Copilot, DALL-E et CLIP
Le modèle de langage écrit du code, et le texte se relie à l'image.
L'explosion publique
- Janvier 2022
InstructGPT et la chaîne de pensée
Le RLHF est appliqué à GPT-3, et le raisonnement pas à pas apparaît.
- Mars 2022
Chinchilla
Les modèles étaient sous-entraînés : il faut plus de données, pas seulement plus de paramètres.
- Août 2022
Stable Diffusion
La génération d'images en poids ouverts devient possible sur un PC.
- 30 novembre 2022
ChatGPT
Un GPT-3.5 entraîné par RLHF derrière une interface de chat. Le transformer sort du labo.
- Février 2023
LLaMA
Meta publie LLaMA, et les poids fuient.
- Mars 2023
llama.cpp et GPT-4
Gerganov écrit llama.cpp, un moteur d'inférence en C/C++ sur CPU sans dépendances : l'IA locale naît. GPT-4 sort le même mois.
- Mai à juillet 2023
QLoRA, l'appel de fonctions, Llama 2
QLoRA permet d'affiner un modèle sur un seul GPU. L'appel de fonctions donne des outils au modèle. Llama 2 sort sous licence commerciale.
- Août à septembre 2023
GGUF et Mistral 7B
Le format GGUF arrive, puis Mistral 7B.
- Décembre 2023
Mixtral 8x7B, Mamba, Gemini
Mixtral est le premier grand MoE en poids ouverts. Mamba propose une alternative à l'attention. Gemini sort.
Raisonnement et agents
- 2024
Claude 3, Llama 3, GPT-4o
Trois familles dans l'année, et le multimodal natif avec GPT-4o.
- Août 2024
L'AI Act entre en vigueur
Le règlement européen s'applique par étapes jusqu'en 2027.
- Septembre 2024
o1 ouvre l'ère du raisonnement
Le modèle réfléchit longuement avant de répondre : on met à l'échelle le calcul à l'inférence, plus seulement l'entraînement.
- Octobre 2024
Deux prix Nobel pour l'IA
Physique pour Hinton et Hopfield, chimie pour AlphaFold.
- Novembre 2024
Le protocole MCP
Le branchement des outils est standardisé.
- Décembre 2024
DeepSeek-V3
Un MoE de 671 milliards de paramètres entraîné à bas coût.
- Janvier 2025
DeepSeek-R1
Le raisonnement en poids ouverts ; Nvidia perd 17 % en bourse en une journée. Les puces AMD Strix Halo arrivent, avec une mémoire unifiée jusqu'à 128 Go.
- Février à mai 2025
Les agents de code
Claude Code et ses semblables se généralisent : le modèle agit dans une boucle d'outils.
- Avril 2025
Qwen3 et Llama 4
Qwen3 sort avec des MoE compacts (30B-A3B) taillés pour le local ; Llama 4 passe au MoE.
- Juillet 2025
Kimi K2, et l'or aux Olympiades
Un MoE ouvert de 1 000 milliards de paramètres. Des modèles atteignent le niveau médaille d'or aux Olympiades de mathématiques.
- Août 2025
GPT-5 et gpt-oss
Premiers poids ouverts d'OpenAI depuis GPT-2, un MoE quantifié en 4 bits. llama.cpp ajoute --cpu-moe : les experts en RAM, l'attention sur le GPU.
- Septembre 2025
Qwen3-Next
Attention linéaire (Gated DeltaNet) mêlée à l'attention classique : le début de la mémoire hybride.
Aujourd'hui
- Novembre 2025 à février 2026
Gemini 3, puis 3.1 Pro
Gemini 3 sort le 18 novembre 2025, Gemini 3 Deep Think le 12 février, 3.1 Pro le 19 février.
- 16 février 2026
Qwen3.5
Un MoE de 397 milliards de paramètres dont 17 actifs, Gated DeltaNet et attention complète, 262 000 tokens de contexte natif, supporté par llama.cpp dès le premier jour. L'architecture hybride devient la norme en poids ouverts.
- Mars et août 2026
Nemotron 3 Super, puis 3.5 Lightning (NVIDIA)
Mamba-2, MoE et quelques couches d'attention. Ces modèles ne sont plus de purs transformers : l'attention quadratique ne subsiste que dans une minorité de couches.
- Juin à juillet 2026
Claude Fable 5, Sonnet 5, Opus 5
La famille Claude 5 sort en trois temps : Fable 5 et Mythos 5 le 9 juin, Sonnet 5 le 30 juin, Opus 5 le 24 juillet.
- 9 juillet 2026
GPT-5.6
Trois variantes, Luna, Terra et Sol ; Gemini 3.6 Flash suit le 21 juillet.
- 1er au 3 septembre 2026
Une semaine de sorties
Claude Fable 5.1 et Mythos 5.1 le 1er, Gemini 3.8 Flash le 2, GPT-6 Astra le 3. Le mot d'ordre commun : l'autonomie des agents sur des tâches longues.
- 3 septembre 2026
Nvidia rachète Hugging Face
12,9 milliards de dollars pour la place centrale des poids ouverts. Le fabricant de puces possède désormais le dépôt où les modèles se partagent.
- Le schéma qui s'installe
Local pour l'ordinaire, frontière pour l'exception
Un serveur llama.cpp local traite l'essentiel des requêtes, un modèle de frontière hébergé traite les cas durs. C'est le schéma que nous appliquons.
En une phrase
En quatre-vingts ans, on est passé d'un interrupteur à seuil (1943) à l'apprentissage par l'erreur (1986), puis à l'échelle (2012 à 2020), au dialogue (2022), au raisonnement (2024) et à l'action (2025). Chaque étape a attendu son ingrédient manquant : l'algorithme, les données, le GPU, l'architecture parallélisable. Ce qui se joue en 2026, c'est la sortie du transformer pur et le partage du travail entre ce qui tourne chez soi et ce qui sort.
Ce que l'histoire apprend, pour la suite
Soyons honnêtes : chaque époque de cette frise a été plus impressionnante que la précédente, et celle-ci ne fait pas exception. Ce qu'un modèle fait aujourd'hui sur une machine ordinaire aurait paru impossible il y a trois ans. Il n'y a aucune raison de penser que ça s'arrête, et rien dans ce que nous voyons en production ne dit le contraire.
Mais la frise apprend autre chose. Deux fois, en 1969 et vers 1987, la promesse a dépassé les moyens et l'hiver a suivi. Chaque bond n'est pas venu d'une annonce, il est venu d'un ingrédient qui manquait : la rétropropagation, ImageNet, le GPU, l'architecture parallèle, le RLHF. Et presque toujours, l'idée existait depuis des années avant que les conditions ne la rendent utile. L'attention date de 2014, le MoE de 2017, llama.cpp d'un week-end de mars 2023.
C'est à ça que sert le recul quand tout s'accélère. Non pas à douter de ce qui arrive, mais à ne pas décider sur la sortie de la semaine. Ce qui compte pour une entreprise ne se lit pas dans l'annonce, il se lit six mois plus tard, dans ce qui tourne réellement, chez soi ou chez un fournisseur, et dans l'ingrédient qui manque encore à son propre cas : les données, le processus, la personne qui vérifie. Ceux qui se sont fait rouler dessus par l'IA ne sont pas ceux qui sont arrivés en retard ; ce sont ceux qui ont acheté l'annonce à la place de l'usage.
Nous tenons cette frise à jour pour cette raison : pas pour suivre la course, pour la regarder d'assez loin.
Sources
- McCulloch et Pitts, A logical calculus of the ideas immanent in nervous activity, 1943
- Turing, Computing Machinery and Intelligence, Mind, 1950
- Rumelhart, Hinton, Williams, Learning representations by back-propagating errors, Nature, 1986
- Krizhevsky, Sutskever, Hinton, ImageNet Classification with Deep Convolutional Neural Networks, 2012
- Bahdanau, Cho, Bengio, Neural Machine Translation by Jointly Learning to Align and Translate, 2014
- He et al., Deep Residual Learning for Image Recognition, 2015
- Vaswani et al., Attention Is All You Need, 2017
- Brown et al., Language Models are Few-Shot Learners (GPT-3), 2020
- Hoffmann et al., Training Compute-Optimal Large Language Models (Chinchilla), 2022
- Ouyang et al., Training language models to follow instructions with human feedback (InstructGPT), 2022
- ggml-org/llama.cpp, premier commit, mars 2023
- Gu, Dao, Mamba: Linear-Time Sequence Modeling with Selective State Spaces, 2023
- DeepSeek-AI, DeepSeek-R1, janvier 2025
- Qwen, Qwen3.5: Towards Native Multimodal Agents, 16 février 2026
- NVIDIA, Nemotron 3.5 Lightning, 11 août 2026
- Google, journal des versions de l'API Gemini
- OpenAI, GPT-5.6, 9 juillet 2026
- OpenAI, GPT-6 Astra, 3 septembre 2026
- Anthropic, chronologie des modèles Claude (dépôt public)
- NVIDIA, NVIDIA to Acquire Hugging Face, 3 septembre 2026
Les entrées jusqu'en 2025 relèvent de l'histoire établie ; celles de 2026 ont été recoupées avec les annonces officielles au 21 septembre 2026.