
I don't know how to feel about Grok 4.7...
Audio Summary
AI Summary
Grock 4.7 est arrivé, et nous allons évaluer ses performances par rapport aux prédictions d'Elon Musk, qui estimait qu'il serait «à peu près à la hauteur d'Opus 5.0, pas 5.1». Le modèle est une amélioration notable par rapport à Grock 4.6, au même prix et à la même vitesse. XAI, l'entreprise derrière Grock, possède désormais Cursor, ce qui est important à noter lors de l'examen des benchmarks.
Selon le blog post, Grock 4.7 est leur modèle le plus performant pour le codage et le travail de connaissance. Il travaille plus longtemps sur des tâches difficiles, vérifie son propre travail plus attentivement et dispose de leurs meilleures mesures de sécurité calibrées à ce jour. Le coût par tâche accomplie est un facteur clé.
Le benchmark Cursorbench 4.0 montre Grock 4.7 en blanc. Il est comparable à Opus 5.0, mais légèrement en deçà sur le réglage de réflexion maximale, tout en étant environ deux fois moins cher. En termes de tokens de sortie par tâche, un indicateur de densité d'intelligence, Grock 4.7 est très comparable à Opus 5.0. Cependant, Fable 5.1 est le grand gagnant en termes de score, mais il est aussi beaucoup plus cher, ce qui augmente considérablement le coût par tâche.
Zapier, le sponsor de la vidéo, est une plateforme d'automatisation qui permet de connecter plus de 9 000 applications. On peut l'utiliser avec Grock 4.7 pour automatiser des tâches, comme analyser des e-mails, créer des tâches dans Asana, puis informer les parties prenantes une fois la tâche terminée. Zapier est un outil précieux pour le travail de connaissance.
En ce qui concerne le nombre d'étapes par tâche, Grock 4.7 est similaire aux autres modèles, avec GPT 5.6 Soul semblant le plus efficace. Fable 5.1 reste en tête sur ce critère.
Le benchmark Deep Suite, considéré comme très précis pour les ingénieurs, place Grock 4.7 à 71 %, derrière GPT 5.6 Soul (72,7 %) mais devant Fable 5.1 (70 %). Il est à noter que la version d'OpenAI, Astra, n'a pas été incluse dans la présentation initiale, ce qui est perçu comme une omission. En incluant Astra, on constate qu'il est le meilleur modèle pour le codage (74,1 %).
Pour les tâches de bureau de plusieurs heures (briefcase multi-hour office work), Grock 4.7 est très compétitif avec Fable 5.1 Max. Cependant, sur Terminal Bench 4.0, crucial pour le codage, Grock 4.7 (38 %) est bien derrière Fable 5.1 (57,9 %) et Astra (58,2 %).
Grock 4.7 excelle dans le travail juridique, dominant tous les autres modèles avec un score de 19,6 %, loin devant GPT 5.6 Soul (2,5 %), Fable (6,7 %) et Astra (5,4 %). Muse Spark 1.2 est le véritable vainqueur dans ce domaine avec 42 %.
Le prix est un facteur important. Grock 4.7 est très abordable à 2 $ par million de tokens d'entrée et 6 $ par million de tokens de sortie, ce qui est nettement moins cher que GPT 5.6 Soul (plus de deux fois plus cher) et Fable 5.1 ou GPT6 Astra (plus de cinq fois plus chers). Cette compétitivité tarifaire s'explique par la grande quantité de ressources informatiques dont dispose XAI et par le fait que Grock 4.7 ne se situe pas à la frontière absolue de l'IA.
Bien que de nombreuses industries soient prêtes à payer plus cher pour la meilleure réponse possible, d'autres privilégient l'automatisation et ne nécessitent pas la performance de pointe absolue. Le tweet de Gavin Baker souligne que les modèles "open weights" sont de plus en plus utilisés en entreprise (62 %) par rapport aux modèles "close weights" (38 %) en raison de leur efficacité, de leur contrôle accru et de leur coût inférieur.
Le benchmark GDPval d'OpenAI montre Fable 5.1 en tête (1735 ELO), suivi de Grock 4.7 (1695 ELO), tandis que GPT Astra est en quatrième position (1542 ELO). Grock 4.7 se montre très performant, proche de la frontière sur certaines tâches.
Grock 4.7 intègre une nouvelle pile de protection, le rendant plus résistant aux refus et aux "jailbreaks". Il est excellent pour les tâches utiles et le refus sécurisé dans des domaines comme la cybersécurité et le travail biologique.
Le modèle a été retardé d'environ une semaine et demie, Elon Musk mentionnant des ajustements sur la longueur des réponses et le contrôle du travail. Ses prédictions passées, comme Grock 4.7 dépassant tous les modèles actuels, n'ont pas été entièrement réalisées, car il est proche de Fable 5 mais