
We Tested Claude Opus 5. It’s Frustrating with Flashes of Brilliance.
AI Summary
La sortie d'Opus 5 marque un moment clé dans le paysage des modèles d'IA, mais les premiers retours le décrivent comme un modèle difficile à apprécier immédiatement. Bien que certains utilisateurs le trouvent peu utilisable, car il s'arrête prématurément ou argumente, des tests plus approfondis révèlent des aspects prometteurs.
Pour les utilisateurs de Codex, la recommandation est de ne pas migrer, car GPT 5.6 reste la référence pour le travail de connaissance et les tâches de codage quotidiennes. Fable, quant à lui, demeure l'outil de prédilection pour les projets plus importants, nécessitant une utilisation alternée. Opus 5 pourrait convenir aux utilisateurs déjà intégrés dans l'écosystème cloud et familiers avec Opus 4.8, mais il pourrait engendrer de la frustration et nécessiter une réadaptation des compétences existantes. Pour ceux qui préfèrent mélanger les modèles ou qui sont dans l'écosystème OpenAI, Opus 5 ne sera probablement pas le modèle préféré dès le départ.
Des observations spécifiques concernant Opus 5, notamment lors de l'utilisation de compétences complexes comme "compound engineering", montrent qu'il a tendance à s'arrêter trop tôt, même lorsque la tâche n'est pas terminée. Ce comportement, moins fréquent avec les modèles précédents, semble se manifester davantage lorsque le modèle est confronté à des instructions complexes ou à des "skills" volumineuses. Cependant, avec des instructions plus simples ou en partant de zéro, il est possible d'obtenir de meilleurs résultats. Cette nécessité d'adapter les prompts et de réécrire les flux de travail existants rend le modèle moins attrayant.
La stratégie d'Anthropic, axée sur la création d'un modèle "super arme" comme Fable pour ensuite en dériver d'autres, contraste avec celle d'OpenAI. Après un modèle précédent moins performant, OpenAI s'est concentré sur l'amélioration post-entraînement, rendant GPT 5.6 plus rapide, plus efficace et plus utilisable pour une large gamme de tâches. Cette approche d'OpenAI, qui privilégie un modèle immédiatement fonctionnel et intuitif, semble gagner du terrain face à la complexité d'Opus 5.
Le niveau de raisonnement est un facteur crucial pour Opus 5, qui semble mieux performer avec un effort de pensée moindre. Cette caractéristique, commune à la famille Claude, suggère que l'effort de réflexion est un paramètre à ajuster.
Historiquement, Anthropic a dominé avec des modèles comme Claude Code, mais une tendance récente voit un retour vers l'écosystème OpenAI, notamment avec la popularité de Codex. La stratégie d'OpenAI, axée sur la facilité d'utilisation, pourrait redéfinir l'équilibre concurrentiel.
En résumé, Opus 5 est un modèle prometteur mais exigeant. Sa personnalité, rappelant Fable, est présente, mais sans son intelligence supérieure. Les utilisateurs devront s'adapter à ses spécificités, et il faudra du temps pour découvrir pleinement son potentiel caché. Pour l'instant, il se présente comme une alternative moins aboutie à Fable, nécessitant une période d'adaptation et potentiellement une révision des méthodes de travail.