
L'IA vient de simuler l'humanité entière (personne n'en parle)
Audio Summary
AI Summary
Cette semaine a été marquée par des avancées extraordinaires dans le domaine de l'IA, particulièrement en open source, qui a pris le contrôle sur de multiples fronts : vidéo, voix ultra-réaliste, musique, objets 3D, et même la simulation de populations mondiales entières.
La chaîne approche des 300 000 abonnés, et un grand merci est adressé à tous pour le soutien. L'abonnement gratuit permet de maintenir toutes les vidéos en accès libre et de les améliorer. Une newsletter quotidienne gratuite est également disponible pour recevoir les informations et idées de la veille.
En ce qui concerne l'IA vidéo, des percées significatives ont été réalisées. Joy AI Video Edit, publié en open source par JD.com, un géant chinois du e-commerce, est un éditeur vidéo piloté par langage naturel. Cela comble un manque cruel dans le monde de l'IA vidéo, car jusqu'à présent, il était difficile d'éditer des vidéos générées ou existantes de manière fiable. À l'instar de l'édition d'images qui a connu un développement similaire avec Nano Banana, l'édition vidéo commence à se perfectionner. Avec Joy AI Video Edit, il est possible de décrire les modifications souhaitées dans une vidéo existante, et l'IA les réalise, même en temps réel avec une latence d'une seconde. Par exemple, transformer une scène de salon en château, changer les vêtements, les décors, l'ambiance, ou retirer un personnage d'un plan. Sur les benchmarks, Joy AI rivalise avec des modèles fermés comme Bernini ou Kling 3 Omni, mais est beaucoup plus rapide. Il s'agit d'un Transformer de diffusion multimodale de 16 milliards de paramètres, capable de générer du 720p à plus de 30 images par seconde. Le modèle pèse environ 32 Go et nécessite un GPU haut de gamme comme une RTX 5090. Il est sous licence Apache 2, sans restriction commerciale, et des versions quantifiées permettant de le faire tourner sur des GPU plus modestes (3070, 3080) sont attendues.
Ensuite, un autre développement majeur concerne l'intelligence elle-même. DeepSeek a publié la dernière version GA de son modèle DeepSeek V4 Pro, le cerveau open source le plus puissant du marché. Il compte 1700 milliards de paramètres en Mixture of Experts (MoE), utilise la technique de décodage spéculatif DeepSpark et dispose d'une fenêtre de contexte d'un million de tokens. DeepSpark est une technique innovante qui rend la génération de mots par IA plus efficace en réduisant la consommation. Cette nouvelle version offre trois niveaux d'effort de raisonnement (low, high, max) selon la complexité de la tâche. Sur les examens d'agent, il rivalise avec les meilleurs modèles fermés. Cependant, DeepSeek a augmenté ses prix de manière significative, passant de 0,87 $ le million de tokens à 4 $ en heure de pointe et 2 $ en heure creuse. Malgré cette hausse, DeepSeek V4 reste compétitif et significativement moins cher que les modèles premium d'OpenAI ou Anthropic (Cloud). Le modèle est open source sous licence MIT, et la communauté travaille déjà sur des versions quantifiées qui pourront fonctionner sur du matériel modeste, sans frais supplémentaires, et de manière 100% locale, sans internet ni censure.
L'intelligence devenant une commodité, l'interface avec le monde réel prend une importance capitale. La voix est l'interface la plus naturelle. Index TTS 2.5 est un générateur de synthèse vocale impressionnant. En lui donnant quelques secondes d'une voix de référence, il peut lui faire prononcer n'importe quel texte dans diverses langues (chinois, arabe, anglais, japonais, espagnol). La version 2.5 apporte quatre améliorations majeures. Ce qui distingue Index TTS, c'est la séparation entre le timbre et l'émotion de la voix, permettant de garder la même voix tout en changeant son état émotionnel (colère, surprise, neutralité). Le cas d'usage le plus spectaculaire est le doublage, où l'on peut cloner la voix d'un acteur et lui faire prononcer un texte dans une autre langue. Le modèle tient dans environ 6 Go, ce qui le rend compatible avec n'importe quel GPU disposant de 6 Go de VRAM.
Google DeepMind a lancé SLT (Sign Language Translator), un modèle IA de traduction de la langue des signes vers le texte. Ce n'est plus un prototype, mais une technologie intégrée au Pixel 11 de Google. Bien que certains y voient un coup marketing, c'est une avancée majeure pour les 70 millions de personnes sourdes ou malentendantes dans le monde. Une personne sourde peut faire des signes devant la caméra de son téléphone, et le texte apparaît en temps réel dans n'importe quel champ de saisie (message, recherche web). Le modèle a été entraîné sur plus de 100 000 heures de données couvrant plus de 50 langues des signes. Au lancement, seule la traduction de la langue des signes vers l'anglais est disponible, mais c'est une première pour un smartphone. L'architecture de SLT est remarquable pour la protection de la vie privée : un modèle embarqué convertit les images en coordonnées géométriques, et seule cette représentation anonymisée quitte le téléphone, la vidéo brute restant locale. Après 15 ans de dictée vocale, le pendant visuel pour la langue des signes est enfin là.
Ensuite, l'outil Mac (Multient CAD), de l'université de Tsinghua, génère des fichiers imprimables en 3D à partir d'une simple description textuelle. L'innovation majeure réside dans son efficacité : il consomme 116 fois moins de tokens que les systèmes précédents pour le même travail, avec un taux de réussite de 99%. Il gère même les assemblages multipièces imprimés en une seule fois avec des jeux précis. Le système détecte les problèmes de géométrie pouvant entraîner des casses à l'impression et ajuste les tolérances automatiquement. Le tout est sous licence MIT avec une interface web incluant un aperçu 3D.
La boucle numérique-physique est fermée, et la question se pose : pour qui ? C'est là qu'intervient Matre AI X, un projet fou de Harvard, du MIT et de Stanford, réunissant 93 chercheurs. L'objectif est de simuler la totalité de la population humaine avec 8,3 milliards d'agents IA Persona, chacun décrit par 1290 attributs (âge, métier, personnalité, habitudes de consommation, etc.). Chaque profil devient un agent interprété par un modèle de langage, capable de remplir des sondages, tester des chatbots, naviguer sur des sites e-commerce ou évaluer des applications. Il s'agit d'une simulation grandeur nature de notre planète basée sur l'IA. La promesse est énorme :