
Deepseek did it again...
Audio Summary
AI Summary
Deepseek V4.1 Flash est une nouvelle version de modèle d'IA, remarquablement économique et rapide, qui, selon les benchmarks, rivalise avec les performances de modèles comme Opus 5 et GPT 5.6 Soul. Cette avancée s'inscrit dans une tendance où les modèles de pointe progressent rapidement, suivis environ six mois plus tard par des modèles open-source performants, puis par des versions plus accessibles pouvant fonctionner sur des ordinateurs personnels. Deepseek a réalisé des gains d'efficacité considérables dans son entraînement.
Les benchmarks positionnent Deepseek V4.1 Flash très favorablement. Sur le benchmark Terminal 3.0, il obtient un score de 30, surpassé uniquement par Opus 5. Sur DeepSuite, il atteint 74.2, devançant Opus et GPT 5.6 Soul. Il s'agit d'un modèle "mixture of experts" (MoE) de 552 milliards de paramètres. Bien que ce nombre soit relativement modeste comparé aux modèles plus récents comme GPT 5.6 (un trillion de paramètres) ou Astra et Fable (probablement 7 à 10 trillions), c'est l'efficacité du MoE qui est remarquable.
Le concept de "mixture of experts" permet au modèle de n'utiliser qu'une partie de ses poids pour générer une réponse, en redirigeant la requête vers les "experts" les plus pertinents. Cela se traduit par une efficacité accrue lors de l'inférence, avec seulement 8 milliards de paramètres actifs pour l'entrée et 16 milliards pour la sortie, malgré la taille totale du modèle. Cette technique est cruciale pour exécuter des modèles plus grands sur du matériel moins puissant.
La vitesse de Deepseek V4.1 Flash est exceptionnelle, rappelant les débuts des modèles très rapides, et surpassant même leur propre modèle précédent, DeepSeek V4 Pro. Sur le benchmark Cyber Gym (cybersécurité), il obtient 88.1, dépassant tous les autres modèles. Cependant, sur le benchmark Exploit Gym (utilisé pour tester les évasions de modèles), il obtient 15, bien en deçà de GPT 5.6 Soul, Claude Opus 5, Fable et Astra.
Pour ceux qui souhaitent essayer Deepseek V4.1 Flash, il est disponible via MinesHub, une plateforme qui centralise l'accès à divers modèles d'IA, avec une facturation unifiée et des fonctionnalités comme le basculement automatique en cas d'échec d'une API. MinesHub propose également un programme "Foundry" offrant jusqu'à 5 000 $ de crédits pour les projets innovants.
Un autre point fort de Deepseek V4.1 Flash est sa réduction drastique des besoins en mémoire. Le cache KV (mémoire du modèle) ne nécessite qu'un quart de la HBM (mémoire à large bande passante) par rapport aux modèles précédents. Cette efficacité est particulièrement pertinente étant donné l'augmentation spectaculaire des prix de la HBM, causée par la forte demande du secteur de l'IA. Le modèle nécessite également 8 fois moins d'espace de stockage SSD. Cette optimisation est présentée comme une solution à la "pénurie de mémoire" mondiale. L'empreinte mémoire totale a été réduite de 4x par rapport à V4.
Ces gains d'efficacité se traduisent par des coûts d'utilisation extrêmement bas. Les prix pour un million de tokens d'entrée varient de 15 à 30 centimes (hors et pendant les heures de pointe), et pour la sortie, de 60 centimes à 1.20 dollar. Ces tarifs sont considérablement inférieurs à ceux des modèles propriétaires de pointe.
Le fait que Deepseek V4.1 Flash soit open-source et open-weights permet aux utilisateurs de le télécharger, de l'exécuter sans partager leurs données, et potentiellement de le faire fonctionner sur leur propre machine s'ils disposent de suffisamment de VRAM. Deepseek a publié un livre blanc détaillant ses techniques, favorisant la recherche et le développement dans la communauté.
Cependant, malgré ses performances impressionnantes sur les benchmarks et sa rapidité, des tests pratiques ont révélé des limitations. La génération d'un essai de mille mots a été extrêmement rapide (environ 6 secondes). Mais des tâches plus complexes, comme une simulation de Rubik's Cube, ont échoué de manière spectaculaire, le modèle ne parvenant pas à gérer la logique de déplacement et de couleur, voire ne résolvant pas le cube. De même, une tâche de réplication d'une image dans Microsoft Paint (via une interface web similaire) a produit un résultat très stylisé et manquant de détail, contrairement à des modèles comme Astra. Une simulation de balle traversant une goutte d'eau a également montré des lacunes dans la qualité de la simulation.
En résumé, Deepseek V4.1 Flash est un modèle open-source remarquable par son efficacité, sa vitesse et son coût, le rendant accessible pour une large gamme d'applications. Il représente une avancée majeure dans l'optimisation des LLM et la démocratisation de l'IA. Néanmoins, il est important de noter qu'il peut encore rencontrer