
Claude Opus 5.5 vient de battre tous les records
Audio Summary
AI Summary
Anthropic a lancé Claude Opus 5.5, une sortie majeure qui marque un tournant dans l'IA. Historiquement, les versions 1.5 d'Anthropic, comme Opus 4.5 fin d'année dernière, ont eu un impact considérable. Ce nouveau modèle a réussi à entraîner un autre modèle d'IA, seul, mieux qu'une équipe humaine, marquant une étape d'auto-évolution. De plus, 10 agents Opus 5.5 ont collaboré pendant 15 heures pour améliorer un algorithme inchangé depuis 1956.
Cette annonce est d'autant plus significative que le modèle le moins cher d'Anthropic surpasse désormais leur modèle le plus coûteux. Cela aura des répercussions sur les prix de l'IA et sur l'avenir de cette technologie, notamment en ce qui concerne l'IA locale, qui fonctionnera bientôt sur nos appareils personnels.
Pour comprendre l'importance d'Opus 5.5, il faut connaître la hiérarchie des modèles d'Anthropic. En bas, nous avons Haiku, puis Sonnet, et au-dessus, Opus, le plus puissant des trois. Au sommet se trouve Fable (et sa version jumelle Mythos, réservée à des organisations spécifiques). Fable 5.1, lancé à 10 dollars le million de tokens en entrée et 50 dollars en sortie, était le haut de gamme.
Or, Claude Opus 5.5, censé être le deuxième niveau, surpasse Fable 5.1 sur presque tous les benchmarks. Il est non seulement meilleur, mais aussi 40% moins cher à opérer. C'est un phénomène rare : plus intelligent, plus rapide et moins cher simultanément.
Les chiffres sont éloquents. Sur le Terminal Bench, qui mesure la capacité de codage autonome, Opus 5.5 atteint 66,4%, contre 55,6% pour Fable 5.1 et 57,9% pour GPT6 Astra d'OpenAI. Sur le GDP Val d'OpenAI, qui évalue le travail de bureau, Opus 5.5 obtient 1846 points, dépassant Fable 5.1 (1735) et GPT6 Astra (1542). Sur l'index d'intelligence d'Artificial Analysis, Opus 5.5 est à 58 points, tandis que Fable 5.1 et GPT6 Astra sont à égalité à 53. Un écart de 5 points est considérable pour ce test. Anthropic a même écrit dans son annonce que, à ce niveau, les écarts de benchmark sont devenus un guide peu fiable, une forme de "fausse modestie" élégante.
Valeyai, une société d'évaluation, a mis 10 agents Opus 5.5 sur un problème de recherche algorithmique : trouver un algorithme de plus court chemin avec une meilleure garantie théorique. Après 15 heures et 733 messages, ils ont produit le CHD, un nouvel algorithme dont la vitesse est formellement prouvée et qui surpasse les meilleures bornes publiées. L'algorithme de référence, Dijkstra, date de 1956. Dix agents IA ont ajouté leur pierre à l'édifice en 15 heures. Bien que le gain soit purement théorique pour l'instant, c'est un pas de recherche vérifié par une machine, non une simple exécution d'instructions.
En termes de coût, Opus 5.5 coûte 4 dollars par million de tokens en entrée et 20 dollars en sortie, soit 20% de moins qu'Opus 5. Les lectures de cache, qui représentent l'essentiel du coût en codage avec un agent IA, passent de 0,50 à 0,20 dollars le million (-60%). Mais le véritable gain est l'efficacité. Un testeur a migré 680 000 lignes de code en moins d'une journée, un travail qui aurait pris des semaines à une équipe d'ingénieurs. En interne, Opus 5.5 a réécrit le HA Proxy (logiciel de répartition de charge) du C vers le Rust en 9h30, coûtant 51% moins cher que Fable 5.1. Au total, cela représente une réduction de coût de 40% par tâche pour un modèle aussi performant.
Un détail crucial, presque inaperçu : Valeyai a annoncé qu'Opus 5.5 est le premier modèle à battre la référence humaine sur leur test LM training. En d'autres termes, le modèle a entraîné un autre petit modèle de langage, seul, en 24 heures avec un budget de calcul fixe, et a fait mieux que les humains. L'auto-amélioration récursive de l'IA n'est plus un concept théorique, mais une réalité mesurée.
Cette situation est paradoxale, car 10 jours avant cette sortie, Dario Amodei, le PDG d'Anthropic, avait publié un essai plaidant pour un ralentissement du rythme d'amélioration des capacités des modèles d'IA, citant l'accélération de l'auto-amélioration récursive et l'incident de sécurité d'OpenAI. Sam Altman et Elon Musk avaient approuvé. Pourtant, Anthropic a sorti Opus 5.5.
Anthropic se défend en affirmant que ralentir ne signifie pas s'arrêter. Ils expliquent que le modèle a été testé par des évaluateurs externes (MR, Frontier Design) et qu'il obtient les meilleurs scores jamais enregistrés sur les audits d'alignement automatisé, avec des garde-fous en place. L'argument est que Opus 5.5 n'est pas un bond en avant, mais une version optimisée d'une intelligence existante (Fable 5.1), rendant cette intelligence plus accessible et abordable. En effet, l'intelligence de Fable est maintenant disponible à un prix divisé par deux par rapport à il y a trois mois.
Pendant ce temps, 89 minutes après l'annonce d'Anthropic, OpenAI a lancé GPT6 Sol et GPT6 Luna. Il est difficile de dire s'il s'agissait d'une réponse panique. OpenAI a visiblement évité la comparaison directe, en comparant GPT6 Sol à Cloud Opus 5 (l'ancienne version) et non à Opus 5.5 dans ses benchmarks. Sur l'index Artificial Analysis, Sol obtient 48 points, tandis qu'Opus 5.5 est à 58. Cet écart de 10 points est énorme dans le monde de l'IA. Sol reste en dessous d'Astra (leur haut de gamme), mais il fait moitié moins d'erreurs que GPT 5.6 et coûte deux fois moins cher (2 dollars le million de tokens en entrée, 10 dollars en sortie). Luna est encore moins cher (10 centimes en entrée, 50 centimes en sortie). Sol est disponible pour les abonnés payants de ChatGPT, et Luna est même gratuit dans l'application de bureau.
Cependant, l'événement majeur est qu'un modèle de deuxième rang chez Anthropic a dépassé le meilleur modèle d'OpenAI sur la majorité des benchmarks, tout en étant beaucoup moins