
Comment Mistral est en train de forger des armes pour l'Europe
Audio Summary
AI Summary
Mistral abandonne la course à la puissance brute pour devenir l'ultime plan B souverain dont l'Europe a désespérément besoin, un plan que l'Europe peut réellement contrôler. Le modèle Mistral large 4 (ML4), surnommé "le Chunk", est un système de 1000 milliards de paramètres, une architecture "mixture of experts" qui active uniquement ce qui est nécessaire à l'instant T. Il est capable de générer des images, de répondre directement ou de raisonner en profondeur, et parle couramment toutes les langues officielles de l'Union Européenne. Ce modèle est conçu pour être polyvalent et s'adresse avant tout aux professionnels, nécessitant une infrastructure serveur conséquente.
Contrairement à ce que l'on pourrait penser, Mistral ne joue pas la même course qu'OpenAI ou Anthropic. Son positionnement est clair : il se compare aux modèles "open weight" chinois tels que GLM 5.3, Dipsic V4, et Kimica3, se positionnant comme le meilleur modèle ouvert hors de Chine, tout en restant en milieu de tableau mondial toutes catégories confondues. Le Chunk est proposé à la fois via une API (pour une prévisualisation) et en open weight, bien que les conditions de téléchargement des poids restent à préciser. Il est important de noter que le modèle est encore en développement actif, avec un apprentissage par renforcement continu.
Les benchmarks publics sont souvent considérés comme du bruit, car les modèles connaissent déjà les sujets des tests. Le seul benchmark réellement valable est celui que chaque entreprise crée avec ses propres données et ses propres ingénieurs. Cependant, certains signaux dans les benchmarks publics sont pertinents. Le Chunk se situe dans la catégorie des poids lourds ouverts, expliquant son classement comme le meilleur modèle ouvert hors de Chine mais en milieu de tableau mondial.
En termes de capacités, le Chunk est aujourd'hui derrière des modèles comme GPT-4, Dipsic et Kimi, notamment sur les tâches de codage. Mistral l'admet honnêtement. Si l'objectif principal est de développer des agents de code autonomes, ce modèle pourrait ne pas être la solution idéale, à moins de contraintes de souveraineté spécifiques.
Le véritable signal que Mistral envoie avec le Chunk concerne les "tâches réglementées", un domaine de spécialité européen. Dans le secteur juridique, sur le benchmark Harvic, Mistral se classe 6ème sur 75 modèles, surpassant GPT-4. En défense, il est à égalité avec GPT-4 pour la localisation d'objets sur imagerie satellite, suite à un partenariat stratégique avec le ministère des Armées français. En cybersécurité, le modèle est dans le top 5 mondial, prenant même la première place sur un test où Claude 3.5 et GPT-4 refusent de participer. Ces domaines (finance, défense, cyber) ne sont pas choisis au hasard ; ils représentent la cartographie stratégique et les enjeux européens.
La stratégie de Mistral est donc de proposer un modèle taillé pour la réalité européenne, celle des banques, des administrations et des armées, où l'envoi de données à des fournisseurs américains est inacceptable. L'objectif n'est pas de briller sur Twitter, mais d'optimiser pour les clients, une stratégie jugée pertinente car la souveraineté ne se limite pas à l'hébergement des données, mais inclut également l'alignement idéologique du modèle.
L'incident de Bercy en juin dernier illustre ce point crucial. L'assistant interne "Ehaistos", basé sur le modèle chinois Quen, a été déconnecté car il produisait des réponses orientées dès que le sujet de la Chine était abordé, malgré le fait qu'il tournait en local sans connexion internet. Cela a démontré que couper la connexion internet ne suffit pas à éliminer les biais idéologiques d'un modèle. La souveraineté réside aussi dans la manière dont le "cerveau" du modèle a été forgé, c'est-à-dire son alignement avec une vision du monde donnée.
En comparant le Chunk, Quen et GLM 5.3 sur des sujets sensibles pour la Chine (Taiwan, Tiananmen), on observe que Quen et GLM 5.3 adoptent des positions conformes à la ligne de Pékin, voire refusent de répondre. Le Chunk, bien que potentiellement moins performant dans ces cas extrêmes, est conçu pour être contrôlable et aligné avec les valeurs européennes. Le mot "contrôlable" prend tout son sens : il s'agit de savoir quelle vision du monde le modèle a ancrée.
Un modèle de langage n'est pas un outil neutre ; il représente une forme de jugement délégué. Ce qui est mis en avant, omis, le ton ou les hypothèses par défaut influencent la décision. La souveraineté implique de décider selon ses propres priorités avant même le lancement de l'inférence. Si l'outil qui prépare la décision embarque les priorités d'un autre, une partie de la souveraineté est perdue. Ce problème est plus grave qu'une simple fuite de données car il est invisible, agit à grande échelle, et est structurel pour les modèles chinois, où la conformité aux "valeurs socialistes fondamentales" est une obligation légale.
Mistral ne cherche pas à battre OpenAI en termes de puissance brute, car la course à l'argent et aux ressources est inégale. Des levées de fonds massives d'OpenAI et Anthropic dépassent largement celles de Mistral. Le Chunk a été entraîné sur environ 4000 GPU, représentant une consommation de 10 MW pendant 2 mois. En comparaison, les supercalculateurs américains consomment des centaines de MW. Mistral atteint 65% des performances du leader mondial en puissance de calcul avec un cluster adverse 100 fois moins puissant. L'avantage de Mistral réside dans l'alignement et une recette spécifique de "post-training" (apprentissage par renforcement), qui sera probablement mise à l'échelle avec leurs nouvelles infrastructures.
Le marché de l'IA se divise en deux : être le meilleur modèle du monde (dominé par les acteurs américains) et être le meilleur modèle que l'on puisse contrôler, hors juridiction américaine et chinoise. Ce second marché était auparavant limité à des modèles ouverts chinois potentiellement risqués ou des modèles occidentaux moins performants. Le Chunk réduit ce dilemme en offrant un modèle occidental un peu moins performant mais totalement contrôlable, souverain et aligné culturellement. Pour une administration ou une banque, ce critère de contrôlabilité pèse plus lourd que quelques pourcentages de benchmark supplémentaires.
Le deuxième pilier stratégique de Mistral est l'infrastructure. Le Chunk a été entraîné sur leurs propres data centers en Europe, sous droit européen, sans dépendance vis-à-vis des géants de la tech. Posséder sa propre puissance de calcul est une assurance vitale, et Mistral se distingue des clouds américains qui, même avec des régions européennes, restent soumis au droit américain.
Le troisième pilier est le sur-mesure. La plateforme Forge permet aux États et aux entreprises d'entraîner leurs propres modèles. Des ingénieurs spécialisés (Forward deployed engineers) s'installent chez les clients pour implémenter ces solutions. Mistral ne vend pas seulement la voiture, mais l'usine, offrant une infrastructure et un harnais où le modèle devient une commodité interchangeable. Le Chunk est le moteur maison qui rend ce harnais crédible et offre une option alignée.
La question pour les décideurs n'est donc pas "quel est le meilleur modèle ?", mais "quel modèle puis-je auditer, héberger, qui restera légal ?". La perte d'accès à un outil de travail en pleine crise est inenvisageable dans des domaines comme la cyber. Le Chunk obtient un score de 82% sur un test de reproduction et correction de failles logicielles, le meilleur score mondial, là où des modèles comme Claude 3.5 et GPT-4 obtiennent un score proche de zéro car leurs filtres de sécurité refusent de participer. Le refus des modèles américains bloque le travail légitime des défenseurs, tandis que les attaquants trouvent déjà des contournements.
Pierre Soler de Mistral affirme que la réplication des poids sur internet rend l'accès impossible à couper, et que le monopole actuel est américain, l'open weight étant la seule issue pour le reste du monde. La barrière d'accès aux modèles a sauté, faisant de la sécurité une course de vitesse. Pour les RSSI, la question est de savoir si leurs défenseurs auront accès aux mêmes modèles que leurs attaquants.
Pour les dirigeants et acheteurs publics, il faut retenir :
1. Le Chunk ne répond pas à "quel est le meilleur modèle ?", mais à "qu'est-ce qui s'arrête si mon fournisseur américain coupe l'accès ?".
2. Tester le modèle avec ses propres contrats et documents, là où il excelle.
3. Compter à la tâche, pas au token, car une tâche complète peut coûter plus cher avec le Chunk qu'avec GLM 5.3.
Pour les bâtisseurs en Europe, le mot d'ordre est de construire des harnais souverains, indépendants du modèle, car le moteur pourrait devoir être changé. Il faut monter sa propre bande d'évaluation et se préparer techniquement à faire tourner 1000 milliards de paramètres chez un client.
Mistral se rapproche davantage de Palantir que d'Alten. Palantir déploie des ingénieurs pour implémenter une plateforme que le client utilise ensuite seul, l'humain étant un coût d'acquisition. La valorisation de Mistral est celle d'un laboratoire, pas d'une société de service, car le Chunk est un actif technologique. Tant que Mistral pourra entraîner ses propres modèles frontières, l'entreprise gardera une chance de devenir un Palantir européen.
Le verdict : le Chunk ne bouleverse pas le classement mondial des meilleurs modèles, mais il change