
Anthropic went CRAZY (Opus 5.5)
Audio Summary
AI Summary
Opus 5.5 d'Anthropic représente une avancée majeure, marquant la première version significative depuis l'appel de l'entreprise à "rythmer la frontière". Ce modèle est une évolution par rapport à Opus 4.5, qui avait déjà révolutionné le codage autonome. Opus 5.5 est plus rapide et 40 % moins cher à l'exécution qu'Opus 5, tout en surpassant Fable 5.1 sur la plupart des benchmarks, ce qui en fait le nouveau modèle de pointe.
Les tests de référence montrent des améliorations spectaculaires. Sur Terminal Bench 4.0, un benchmark crucial pour le codage agentique qui mesure la capacité d'un modèle à exécuter des commandes dans un terminal, Opus 5.5 atteint 66,4 %, dépassant Astra (57,9 %) et Fable 5.1 (55,8 %) de plus de 10 points. Sur Frontier Code V1.1, il obtient 54,4 %, comparable à Astra et légèrement supérieur à Fable (50 %). Le Cursorbench, un autre benchmark important, enregistre 57,8 % pour Opus 5.5, contre 51 % pour Fable 5.1. Ces améliorations ne sont pas de simples ajustements incrémentiels, mais des bonds massifs en performance.
En ce qui concerne le travail de connaissance, le score ELO de Opus 5.5 sur le benchmark GDP Val 2.1 d'OpenAI, qui évalue des tâches du monde réel comme la création de présentations, la saisie de données et le traitement de texte, atteint 1846. C'est un gain de plus de 300 points par rapport au précédent leader, Fable 5.1 (1735), et bien au-dessus de GPT-6 Astra (1542). Cela indique une capacité exceptionnelle à gérer le travail de bureau et les tâches complexes.
Bien qu'il n'ait pas atteint la première place sur tous les benchmarks, comme Automation Bench (où Astra a obtenu 41,4 % contre 40 % pour Opus 5.5), il a montré des gains significatifs sur d'autres, tels que "Humanity's Last Exam", où il a marqué 67 % contre 57 % pour Astra et 65 % pour Fable 5.1. Sur Terminal Bench Science, il a obtenu un score de 58 %, supérieur à Fable 5.1, mais derrière GPT-6 Astra. En matière d'utilisation informatique, une compétence de plus en plus cruciale, Opus 5.5 atteint 81,8 %, légèrement au-dessus de Fable 5.1 (80,7 %).
La tarification d'Opus 5.5 reflète également une amélioration. Le prix d'entrée est de 4 $ par rapport aux 5 $ d'Opus 5, ce qui représente une réduction de 20 %. Pour les jetons de sortie, il coûte 20 $ par million, contre 25 $ pour Opus 5. Les réductions de prix sont également notables pour les lectures et écritures en cache. Cependant, le coût par tâche est le critère le plus pertinent. Opus 5.5 est non seulement moins cher, mais aussi plus rapide, générant des résultats 30 % plus rapidement qu'Opus 5. Cela signifie une réduction de coût totale de 40 % sur les charges de travail typiques, car il utilise moins de jetons pour accomplir la même tâche.
Un graphique de l'Automation Bench illustre clairement la supériorité d'Opus 5.5 : il se positionne dans le quadrant supérieur gauche, indiquant la meilleure qualité pour le coût par tâche le plus bas. Sur Frontier Code, les performances d'Opus 5.5 sont également exceptionnelles, avec des scores élevés pour un coût minime, en particulier pour les réglages d'effort "moyen" et "élevé". Sur GDP Val, il domine tous les autres modèles en termes de score ELO et de coût par tâche. Sur Terminal Bench, il surpasse tous les concurrents, avec une performance particulièrement forte pour les réglages d'effort "élevé" et "moyen".
Au-delà des chiffres, Opus 5.5 communique plus naturellement, plaçant les informations les plus importantes en premier et suivant les règles d'écriture données, ce qui facilite les sessions longues, en particulier pour la gestion de multiples agents de codage. Cette concision est essentielle pour la commutation de contexte et la productivité.
Le modèle a été rigoureusement testé par des évaluateurs externes et a fait l'objet d'un audit comportemental automatisé, obtenant les meilleurs scores en matière de sécurité. Il est moins susceptible de prendre des mesures irréversibles ou d'agir en dehors de ses limites, une référence aux incidents passés. Anthropic a également élargi ses tests d'alignement pour couvrir des tâches plus longues et "impossibles". En raison de ses capacités en biologie et cybersécurité, comparables à celles de Claude Mythos 5.1, il est déployé avec des garde-fous similaires à ceux de Claude Fable 5.1. Des programmes de vérification pour les sciences de la vie et la cybersécurité sont en place, soulignant la nature à double usage du modèle.
Tharic, membre de l'équipe technique d'Anthropic, a confirmé qu'Opus 5.5 est à la fois plus intelligent et moins cher. Il le considère comme un excellent choix pour un "daily driver", tandis que Fable 5.1 pourrait être préféré pour des tâches de planification, de révision de code ou de sécurité très critiques, où la précision est primordiale et le coût moins sensible. Tharic a expliqué que le développement de ce modèle s'inscrit dans la stratégie d'Anthropic de créer une intelligence de pointe, puis de la rendre accessible à grande échelle, une approche observée avec les versions précédentes comme Opus 4.0 et 4.5.
Interrogé sur le nom "5.5", Tharic a indiqué qu'il ne fallait pas trop s'attacher aux chiffres, car tous les modèles sont très performants. Cependant, il a reconnu l'enthousiasme général au sein d'Anthropic pour cette version. Concernant l'appel de Dario Amodei à "rythmer la frontière", Tharic a précisé que cela concerne les modèles les plus récents et souvent non encore publiés, dont les capacités sont encore en cours d'évaluation et qui nécessitent des tests approfondis pour la sécurité. Cependant, l'objectif est de rendre ces capacités accessibles au public une fois qu'elles sont jugées sûres et robustes, comme c'est le cas avec Opus 5.5.
Tharic a également mentionné que Claude aide à construire Claude, ce qui est une forme d'auto-amélioration récursive. Il s'agit d'un processus continu de petites améliorations, plutôt que d'une transformation soudaine. Les modèles écrivent une grande partie de leur propre code, ce qui contribue à cette évolution.
Concernant les choses qu'il aimerait voir améliorer, Tharic a souligné l'utilisation de l'ordinateur et du navigateur. Bien que les modèles s'améliorent sur les benchmarks, il est nécessaire de les aider à mieux exprimer ces capacités. Il a également évoqué la nécessité pour les modèles de mieux comprendre le contexte de l'utilisateur et d'avoir une meilleure mémoire, afin de suggérer des actions pertinentes sans être intrusifs.
Enfin, Tharic a insisté sur l'amélioration des capacités d'appel d'outils d'Opus 5.5, ce qui est très prometteur pour les agents gérés par le cloud. Il a mentionné que l'équipe travaille constamment à optimiser les "harnesses" (les systèmes qui encadrent l'utilisation du modèle) pour tirer le meilleur parti de l'intelligence du modèle, réduisant les prompts système et ajustant les outils pour éviter de le contraindre.
En résumé, Opus 5.5 est un modèle exceptionnel qui redéfinit la frontière de l'IA. Il offre des performances supérieures, une vitesse accrue et un coût réduit, ce qui en fait un outil puissant pour le codage et le travail de connaissance, tout en intégrant des avancées significatives en matière de sécurité et de communication naturelle.