
La Chine vient de construire l'IA impossible
Audio Summary
AI Summary
DeepSeek vient de révolutionner le domaine de l'IA avec un modèle qui défie les attentes. Alors que la tendance actuelle consiste à investir massivement dans le matériel informatique (GPU, centres de données) et l'énergie pour développer des IA plus puissantes, une approche plus ingénieuse et économique a émergé. DeepSeek, un laboratoire chinois disposant de ressources limitées et sans accès aux puces les plus performantes, a réussi à concevoir un modèle dont les performances rivalisent avec celles de GPT-4o d'OpenAI, mais avec un coût d'inférence 40 fois inférieur.
Cette percée d'efficience est comparée à l'avènement des centrales nucléaires, marquant un tournant où le coût de l'intelligence devient comparable à celui de l'énergie. Contrairement à la méthode "force brute" adoptée par la plupart des acteurs majeurs de l'IA, DeepSeek a réinventé le fonctionnement interne de ses modèles. Leurs choix techniques, apparemment contre-intuitifs, reposent sur une logique d'une précision redoutable.
Pour comprendre cette innovation, il est essentiel de saisir le problème qu'elle résout : le "KV cache". Lors du traitement d'une requête (prompt), le modèle IA effectue deux phases. La première consiste à lire et analyser le texte, créant des "notes" sous forme de paires clé-valeur appelées KV cache. La seconde phase est la génération de la réponse, mot par mot (ou token par token), où le modèle consulte son KV cache pour éviter de tout recalculer. Sur des prompts courts, le KV cache tient dans la mémoire rapide du GPU. Cependant, avec l'usage croissant de prompts longs (documents volumineux, conversations étendues), le KV cache devient si volumineux qu'il déborde de la mémoire rapide du GPU et doit être stocké sur des supports plus lents (SSD, RAM). Cela entraîne des ralentissements considérables, car le modèle doit attendre le rapatriement de ces données. Ce phénomène explique en partie la flambée du prix des cartes graphiques haut de gamme, plus dotées en mémoire.
L'industrie a traditionnellement répondu à ce problème en augmentant la puissance de calcul et la mémoire des GPU, un approché coûteux en énergie et en investissement. DeepSeek a adopté une stratégie différente en s'attaquant aux deux goulots d'étranglement : le calcul et la bande passante.
Leur première innovation consiste à diviser le modèle en deux. Au lieu que chaque couche du modèle lise intégralement le contexte, seules les 20 premières couches effectuent cette lecture et remplissent le KV cache. Les 20 dernières couches récupèrent directement ces notes pour générer la réponse, sans relire le contexte. Bien que cela puisse sembler rendre le modèle moins performant, la seconde moitié maintient un focus précis sur les derniers tokens générés pour assurer la cohérence. Le coût de la phase de lecture est ainsi divisé par deux.
La deuxième trouvaille, la plus élégante, concerne la gestion du KV cache lui-même. Traditionnellement, chaque couche du modèle génère son propre jeu de notes, entraînant une redondance massive. DeepSeek a limité la génération de notes à seulement quatre couches sur les quarante. Les autres couches utilisent les notes existantes, travaillant "à crédit". Cela réduit drastiquement la taille du KV cache, permettant à des modèles nécessitant auparavant des centres de données entiers de fonctionner sur du matériel accessible aux particuliers ou aux petites entreprises.
La troisième décision, la plus audacieuse, concerne la mémoire à court terme. Les modèles IA conservent généralement les 128 derniers tokens générés pour assurer la cohérence conversationnelle. Cette mémoire locale est habituellement sauvegardée sur disque, ce qui sature ces derniers. La solution de DeepSeek est de supprimer complètement cette mémoire à court terme. Au lieu de la sauvegarder, le GPU recalcule les 128 derniers tokens à chaque nouveau tour de conversation. Ce recalcul, négligeable pour un GPU moderne, est bien plus rapide que la recherche et le transfert de données depuis un disque dur. DeepSeek a compris que sauvegarder une mémoire lente coûtait plus cher que de recalculer une information rapide.
Ces optimisations, couplées à un mécanisme de décodage spéculatif (Dispark), ont conduit à des performances remarquables. Sur le benchmark de code DeepSeek SWE, le modèle atteint le même score que GPT-4o. Sur le Vals index, qui mesure la performance dans des cas d'utilisation réels en entreprise, DeepSeek V4.1 Flash est classé numéro un. La vitesse de génération est de 208 tokens par seconde, près de trois fois la médiane des modèles comparables.
Le coût est le point le plus spectaculaire : 15 centimes par million de tokens en entrée et 60 centimes en sortie, contre 10 et 50 dollars pour les modèles d'OpenAI. Le modèle, avec 552 milliards de paramètres, est publié sous licence MIT avec des poids ouverts, favorisant une adoption rapide et une communauté de développeurs active.
Cette approche contraste fortement avec la situation en France et en Europe, malgré l'accès aux GPU et à des chercheurs talentueux. La Chine, avec moins de moyens et des contraintes matérielles, produit des modèles de pointe open source, tandis que l'Europe peine à créer des alternatives comparables. DeepSeek démontre que l'architecture et l'ingéniosité peuvent surpasser la seule puissance matérielle.
Ce changement de paradigme, comparable à la révolution de l'électricité, rend l'intelligence artificielle accessible à un coût dérisoire. Le prix du token devrait continuer à chuter, favorisant ceux qui maîtrisent la production d'IA à bas coût. L'avenir de l'IA ne sera plus l'apanage des grandes entreprises, mais sera accessible à tous, la barrière devenant le savoir-faire et l'intégration de ces outils. L'académie Vision IA propose de former à la maîtrise de l'IA locale, à l'orchestration des différents modèles et à leur monétisation, ouvrant ainsi des opportunités considérables dans un marché en pleine expansion.