
L'IA est hors de contrôle (Matrix arrive)
Audio Summary
AI Summary
Cette semaine a été marquée par huit avancées majeures en IA, témoignant d'une transition de l'IA du texte vers le monde réel.
La première avancée est **Meridian**, un nouveau modèle open source de Vigle, basé sur Minimax H3. Il permet de modifier l'angle de caméra d'une vidéo existante après coup. Contrairement à un simple zoom, Meridian reconstruit la scène en 3D à partir de la vidéo, estimant la profondeur de chaque élément pour générer un nuage de points tridimensionnel. Une fois la reconstruction effectuée, l'utilisateur peut manipuler la caméra (orbiter, panoramique, zoom, effet bullet time) et le système rend une version brute sous le nouvel angle, puis la passe dans Minimax H3 pour une vidéo finale de haute qualité. Le modèle pèse 62 Go, mais des versions plus légères sont attendues. Cette technologie révèle une compréhension de plus en plus fine de l'espace par l'IA.
La deuxième avancée concerne **GPT6 Astra** d'OpenAI, qui a réussi à déchiffrer un message Enigma de la Seconde Guerre mondiale, resté non résolu pendant 85 ans. Un développeur de Bloomberg, Carter Lefen, a confié le problème à Astra. Le modèle a mené une enquête de cryptoanalyse sur environ 10 heures, fouillant des archives historiques, comparant des transcriptions incertaines, cherchant des indices dans d'autres messages et construisant son propre simulateur Enigma. Il a même repéré des fautes de frappe de l'opérateur original. Le texte en clair a révélé une demande de route de marche. Bien que Lefen ait guidé l'investigation, Astra a réalisé l'essentiel du travail technique. Ce même système a également déchiffré une transmission radio allemande de 1919. Cette capacité d'enquête complexe et structurée ouvre de nouvelles perspectives pour la découverte historique, notamment pour les milliers de messages cryptés et codés non lus.
La troisième avancée est le projet de recherche de Google appelé **Dream RSI** (Recursive Self Improvement). Il ne s'agit pas d'une IA qui réécrit son code, mais d'une IA qui améliore sa stratégie de réflexion et d'exploration d'un problème. À chaque tâche, elle crée un "arbre de découverte" cartographiant ses tentatives, réussites et échecs. Le système peut ensuite rejouer cet arbre des milliers de fois pour générer des stratégies d'exploration améliorées, les tester contre son historique et déployer la meilleure. Cette auto-amélioration est "quasi gratuite" en termes de calcul car les données de l'arbre existent déjà. Les agents Gemini 3.1 Pro et Gemini 3.7 Flash ont obtenu des résultats comparables ou supérieurs aux systèmes existants avec deux fois moins d'appels au modèle, grâce à cette amélioration stratégique.
La quatrième avancée nous fait passer dans le monde physique avec le système **GPT policy**. Un robot peut apprendre une nouvelle tâche en observant un humain la réaliser, sans réentraînement ni fine-tuning du modèle. C'est de l'apprentissage in-context appliqué à la robotique. L'IA peut utiliser des vidéos de démonstration (humain ou robot) ou même une simple image du résultat final, ainsi que le feedback d'essais ratés. Branché à un modèle de vision-langage généraliste comme GPT6 Astra, le robot tente de reproduire la tâche. Par exemple, un robot qui ne parvenait pas à attraper une serviette rouge a réussi deux fois sur trois après avoir vu un humain le faire. Le même succès a été observé pour dévisser un bouchon de bouteille. Cette capacité réduit considérablement le temps et le coût de l'entraînement des modèles robotiques.
La cinquième avancée est **Odyssée 3**, un modèle de fondation unique pour la robotique, capable de contrôler différents types de machines : bras robotiques, humanoïdes, voitures autonomes, drones, agents de jeux vidéo. Techniquement, Odyssée 3 est un transformeur de diffusion autorégressif qui apprend une compréhension large du monde (mouvement, physique, causes, effets, comportements humains) à partir de grandes quantités de données visuelles. Un "action décodeur" spécifique traduit ensuite cette compréhension en commandes motrices pour chaque machine. L'entraînement coûteux se fait une seule fois, et l'adaptation à chaque robot nécessite peu de données. Les résultats sont impressionnants : bras robotiques corrigeant des erreurs, humanoïdes manipulant des objets avec finesse, drones contrôlés par le même modèle, le tout en zéro-shot (sans entraînement spécifique). Avec seulement 20 heures de données de conduite simulée, Odyssée 3 a appris à rouler dans les rues indiennes. Le modèle a également transféré des mouvements équestres d'un agent de GTA vers Red Dead Redemption 2. Odyssée 3 se distingue en revendiquant un seul "backbone" pour cinq types de machines.
La sixième avancée concerne le monde professionnel avec **Astra for Law** d'OpenAI, une version de GPT6 Astra configurée spécifiquement pour le travail juridique. Au lieu d'une recherche web classique, le système utilise un index juridique dédié de plus de 230 millions d'URL, couvrant la jurisprudence américaine et mise à jour quotidiennement. Un avocat peut lui fournir un dossier, et le système recherche les précédents pertinents, expose les arguments des deux parties, rédige des éléments de preuve et analyse les risques contractuels. Sur le benchmark Legal Research Bench, Astra for Law atteint 54% de résultats juridiquement pertinents au plus haut niveau de raisonnement, contre 38,7% pour GPT6 Astra classique. Il trouve également 24% de cas supplémentaires. OpenAI propose un mode de rétention de données zéro pour les clients éligibles.
La septième avancée est la création de mondes entiers par **XG Labs** avec **Jing et Dao**, deux modèles formant une simulation de monde génératif. Dao est le moteur du monde, stockant l'état partagé de l'environnement, appliquant les règles et permettant aux agents autonomes d'agir même sans supervision. Jing est le modèle d'expérience, générant ce qu'un personnage précis devrait voir de son propre point de vue. Le concept central est la persistance : si un joueur quitte une zone, Dao continue de gérer ce qui s'y passe, et tout reste cohérent au retour. Le monde peut être généré indéfiniment, et plusieurs joueurs ou agents IA peuvent interagir simultanément, chacun avec sa perspective générée par Jing. Contrairement à d'autres modèles qui génèrent des vidéos interactives sans simulation de monde, Jing et Dao simulent réellement le monde. XG Labs vise un "Oasis", un monde partagé et persistant que les gens pourraient habiter, où les choix ont des conséquences durables. Jing est également construit sur Minimax H3, comme Meridian, soulignant l'importance de ce modèle pour la compréhension de l'espace, du mouvement et de la physique.
Enfin, la huitième et dernière avancée est **Jeev**, un nouveau modèle d'IA conçu uniquement pour prendre des décisions, sans générer de texte, de conversation ou de code. Contrairement aux modèles qui réfléchissent mot par mot, Jeev prend une situation et une liste de choix possibles, puis renvoie un score de confiance pour chaque option en 70 à 500 millisecondes. Par exemple, pour un e-mail, il pourrait suggérer "comptabilité 92%" ou "urgent 74%". Le co-inventeur de ChatGPT chez OpenAI, Diogo Almeida, a passé deux ans à le construire. Cette capacité de décision instantanée est cruciale pour la robotique (humanoïdes, drones, véhicules autonomes).
En résumé, en une semaine, l'IA a démontré des capacités à reconstruire des mondes en 3D, mener des enquêtes complexes, améliorer ses propres méthodes de travail, contrôler des machines par simple observation, se spécialiser dans des domaines professionnels, simuler des mondes persistants et prendre des décisions en temps réel. La frontière entre l'IA qui parle et l'IA qui agit est en train de disparaître, marquant une accélération significative de la transformation de l'IA.