
We Tested Anthropic's Fable 5.1 for a Week
AI Summary
C'est le jour de la sortie d'un nouveau modèle. Nous avons le tout nouveau Fable 5.1, et il est conçu pour tout le monde. Nous l'avons testé pendant environ une semaine. C'est un modèle exceptionnel. Il est meilleur pour le codage que le Fable original. Donc, si vous avez aimé le Fable original, vous aimerez encore plus ce nouveau modèle. Et il parle anglais. Il vous parle comme une personne normale. Il dit des choses que vous pouvez comprendre. Et ce n'est pas tout. Il est considérablement plus rapide. Il est environ deux fois plus rapide que l'ancien Fable et utilise deux fois moins de tokens que Opus 5 pour des tâches similaires. Il est donc proposé au prix d'un Fable, mais vous pourrez l'utiliser pour toutes vos tâches Opus. Et il n'y a vraiment plus aucune raison d'utiliser Opus. Fable à fond, c'est parti !
Alors, entrons dans le vif du sujet. Avant de commencer cette vidéo, qui suis-je et comment puis-je avoir une critique complète d'un modèle qui vient d'être lancé ? Je m'appelle Dan Shipper et je suis le co-fondateur et PDG d'Every. Every est le seul abonnement dont vous avez besoin pour rester à la pointe de l'IA. Nous obtenons tous les modèles avant leur sortie et nous les testons avec une équipe de rédacteurs, de designers, d'ingénieurs et plus encore pour vous dire à quoi ils servent. Ainsi, le jour où un modèle est lancé, nous avons des critiques approfondies pour vous dire quand les utiliser et quand ne pas les utiliser, basées sur notre expérience réelle de travail. Nous avons donc testé ce modèle sur toutes sortes de choses que vous faites au quotidien. Nous avons testé le codage, le travail de connaissance comme la création de contenu et l'analyse de données, ainsi que la rédaction. Et je vais vous montrer tout ce que nous avons découvert lors de notre utilisation et comment cela a influencé mon utilisation au jour le jour. Quels sont les chiffres réels de l'évolution de mon utilisation au cours de la semaine depuis que j'ai eu accès à ce modèle ? Commençons.
L'une des choses les plus cool que j'ai dû construire est une chose appelée "Hands". C'est un agent d'utilisation d'ordinateur qui s'exécute sur mon ordinateur et permet à d'autres agents d'utiliser mon ordinateur à distance. C'est la flèche pour Hands. C'est Hands qui utilise mon ordinateur. Et vous pouvez voir qu'il y a une petite fenêtre sur mon ordinateur qui me montre ce que Hands fait. Et ce que cela fait, c'est me permettre d'utiliser mon ordinateur à distance à partir de n'importe quel agent que je veux. Et c'est une chose difficile à construire. Il est difficile de créer une application Mac qui soit un agent d'utilisation d'ordinateur, accessible depuis le web, capable d'accomplir n'importe quelle tâche que vous lui demandez. J'ai essayé de construire Hands avec Fable 5.6, avec le Fable régulier, et c'était bien, mais ça ne fonctionnait pas vraiment. Et cela fonctionne réellement. Il utilise mon ordinateur, et je peux lui faire utiliser mon ordinateur depuis Slack, et c'est… incroyable. Regardez ça. C'est… incroyable. Et regardez, il va commencer à taper aussi. Et vous pouvez voir qu'il travaille dans ChatGPT. Vous pouvez voir qu'il tape. Il tape. Et je n'ai aucune idée de comment cela fonctionne. Ceci a été construit de bout en bout par Fable 5.1 à partir de quelques prompts. C'est un agent de bureau entièrement construit par ce modèle. C'est donc une application entièrement fonctionnelle. Elle a une capture d'écran de l'état actuel. Elle indique ce qu'elle fait. Elle a un journal. Regardez, regardez. Ce sont toutes les tâches que j'ai effectuées avec cette chose. Cela prendrait normalement des mois pour être bon, et cela a fonctionné après une journée. J'ai donné un prompt à Fable 5.1, et il a fonctionné sur Ultra Code avec environ 40 sous-agents pendant une journée, et puis c'est sorti, et ça fonctionne. Je ne sais pas comment le dire autrement. C'est une expérience de programmation complètement différente de pouvoir donner un simple prompt à un modèle et d'obtenir une application complexe entièrement utilisable un jour plus tard.
Cela dit, il y a certaines choses à prendre en compte. Il est plus efficace en termes de tokens qu'Opus 5, mais si vous lui donnez une tâche importante comme celle-ci sur Ultra Code, elle s'exécutera pendant une journée et consommera… c'est une exécution de 3 à 5 millions de tokens. Donc, cela peut devenir coûteux, surtout sur Ultra Code. Il n'est pas vraiment très conversationnel. Il est conversationnel pour des tâches moins exigeantes, mais si vous le mettez sur Ultra Code, il va essentiellement partir et travailler et revenir plus tard. C'est donc un modèle d'utilisation différent de ce à quoi vous pourriez être habitué. Il est meilleur, surtout pour les grands projets, moins pour le codage interactif, mais c'est… génial. Et les autres personnes techniques chez Every, comme Kieran Classen, qui est GM de Kora et crée Compound Engineering, adorent ce modèle. Pour Kieran, qui est un fan de Claude depuis longtemps, et même lui n'aimait pas Opus 5, n'aimait pas Sonnet 5, et ce modèle, il dit : « C'est à nouveau mon préféré. » C'est donc un grand saut en termes de puissance et de facilité d'utilisation, qui ne vont généralement pas de pair, et de vitesse. Il est juste assez rapide pour être utilisé pour les tâches quotidiennes.
Pour vous donner une idée de son niveau d'efficacité et de sa rapidité, nous l'avons exécuté sur notre benchmark interne d'agents. Cela mesure ses performances sur des tâches que notre agent interne effectue au sein d'une entreprise, et nous l'avons comparé à Opus 5. En termes de nombre de tokens par exécution, en moyenne, ce modèle a consommé environ 766 tokens par exécution. Chaque requête au modèle représentait environ 766 tokens. En comparaison, Opus 5 utilisait près de 2 000 tokens pour les mêmes tâches. De même, la latence moyenne de ce modèle était d'environ 22 secondes. C'est le temps nécessaire pour obtenir une réponse à une requête de base. 22 secondes. Opus prenait environ 37 secondes. Il est donc environ deux fois plus rapide qu'Opus. Et il utilise environ la moitié des tokens. C'est vraiment incroyable. Et c'est un bond très rare. Il y a eu un moment en décembre 2025 où Opus 4.5 et GBT 5.3 ont franchi cette barrière où soudainement toutes ces utilisations de codage ont vu le jour et où tout le monde a découvert que l'on pouvait coder de cette nouvelle manière avec ces modèles. Je pense qu'une chose similaire se produit avec Fable 5.1, car il ouvre ces tâches à long terme sous une forme facile à utiliser et suffisamment abordable pour que les gens ordinaires puissent l'essayer. Je pense qu'il a la possibilité d'ouvrir la délégation réelle des tâches de codage et de travail de connaissance à des travailleurs du savoir plus moyens, et c'est une chose importante.
Passons maintenant au travail de connaissance. Nous avons ce spectateur d'évaluations très cool. Je peux donc vous montrer exactement sur quoi