
How Real-Time AI Video Is Changing How Creators Work
Audio Summary
AI Summary
Le média génératif, associé au marché des agents de codage, représente ce que l'on appelle le "token market fit". Tout le monde attend un grand moment de consommation pour l'IA. H3 Max, un modèle post-entraîné, est considéré comme un facteur clé pour rendre cela possible. Ce modèle a démontré une accélération et un gain significatifs par rapport à sa version d'origine. Par exemple, une version publique, H3 Max Turbo, peut générer une vidéo de 5 secondes en environ 1,5 seconde, et ce, à un coût deux fois moindre, ouvrant ainsi de nouvelles possibilités pour Hollywood et les professionnels.
L'équipe derrière H3 Max s'est concentrée sur la vitesse, la performance et la qualité, établissant une base solide. Le modèle Minimax H3 est le premier modèle vidéo véritablement open source, très performant et de dernière génération. Cette opportunité a poussé l'équipe à investir massivement dans le post-entraînement, combinant diverses approches pour obtenir des résultats exceptionnels, comme le montrent les graphiques.
L'idée de se lancer dans le post-entraînement de modèles open source est née de la conviction que le média génératif, comme le marché des agents de codage, atteint un point de "token market fit". Cela signifie qu'une seule personne peut dépenser de manière productive un grand nombre de tokens (environ 10 000 par mois). Il existe une demande incroyable sur le marché pour générer des vidéos et d'autres contenus simultanément. Les professionnels qui font cela quotidiennement dépensent des milliers de dollars en tokens. Depuis avril, l'industrie et l'entreprise elle-même sont confrontées à des contraintes de calcul. L'équipe recherche constamment des moyens d'améliorer l'efficacité pour permettre une utilisation accrue. H3 Max arrive à point nommé, rendant tout un ordre de grandeur plus efficace, ce qui libère des ressources de calcul pour d'autres modèles ou permet de générer plus de tokens avec H3 Max.
Les optimisations au niveau du système, mises en œuvre au cours des trois ou quatre dernières années, ont permis d'accélérer les modèles de deux à trois fois tout en maintenant la même qualité. Cependant, les nouvelles optimisations liées au post-entraînement, combinées à la co-conception système/modèle, permettent de dépasser ces limites d'un ordre de grandeur. L'équipe a expérimenté l'infrastructure de post-entraînement sur des modèles d'image open source avant les modèles vidéo, notamment avec Ideogram et Flux. Cette expérience a permis de développer des noyaux et une conception système pour exécuter les modèles très rapidement, créant ainsi des versions spécialisées qui surpassent les performances obtenues en exécutant simplement le modèle de base. La combinaison de cette expertise et de l'accès à un modèle vidéo de pointe a conduit à une amélioration de la vitesse d'un ordre de grandeur.
Les gains d'efficacité sont stupéfiants, avec des coûts considérablement réduits et une vitesse accrue, jusqu'à 35 fois plus rapide que le modèle Minimax original. Il n'y a pas eu de sacrifice de qualité, comme en témoigne le score ELO. La "recette secrète" réside dans un effet cumulatif de multiples variables d'optimisation. Premièrement, le post-entraînement du modèle de base le rend plus efficace pour les modèles de diffusion, réduisant le nombre d'étapes de 50 à environ 20. Cependant, cette réduction d'étapes peut entraîner une perte de qualité. L'approche a donc consisté à améliorer d'abord la qualité du modèle via le post-entraînement et les pipelines RL, puis à appliquer la pile d'optimisation. Le résultat final est une qualité égale ou supérieure à celle du modèle original, mais avec une vitesse un ordre de grandeur plus rapide.
La majeure partie des gains provient du post-entraînement du modèle pour qu'il soit compatible avec un nombre réduit d'étapes. À cela s'ajoute le travail d'ingénierie des noyaux et des systèmes, qui augmente l'utilisation du matériel de 30-40% (standard pour de nombreuses charges de travail d'inférence) à 70-80%, atteignant ainsi la limite théorique de l'unité de calcul matriciel (MFU).
De plus, ces modèles ne se limitent pas à une simple invite textuelle produisant une vidéo. Ils impliquent des pipelines complexes. Une invite est d'abord étendue par un grand modèle de langage (LLM) pour s'adapter au format d'entraînement du modèle. La vidéo est ensuite générée dans l'espace latent, puis décodée en pixels. Un composant de mise à l'échelle peut également être impliqué. Chaque composant, par défaut, n'est pas optimisé. L'équipe a maximisé l'efficacité de chaque composant. Cela inclut des optimisations spécifiques pour l'expansion des invites (opérant à de faibles tailles de lot et sans mise en cache), des optimisations pour le modèle de diffusion et des optimisations pour le VAE qui convertit les latences en pixels. La combinaison de toutes ces optimisations a un effet cumulatif.
Du point de vue matériel, passer des architectures Hopper à Blackwall offre une amélioration de 2 à 3 fois, mais le coût est comparable. Cela réduit le temps d'exécution réel mais n'améliore pas nécessairement l'efficacité intrinsèque. Cependant, cela est crucial pour des objectifs dépassant considérablement le temps réel, comme générer 5 secondes de vidéo en moins de 2-3 secondes, ce qui nécessite le matériel de dernière génération.
La plupart des modèles vidéo actuels s'exécutent sur une configuration de nœud unique (8 GPU). Au-delà de 8 GPU, l'efficacité diminue en raison des surcharges de communication. H3 Max suit cette configuration, s'exécutant en parallèle sur huit GPU.
L'équipe a également lancé une version "Turbo" de H3 Max. Initialement, ils ne voulaient pas l'appeler Turbo car la qualité était déjà meilleure que l'originale. Cependant, une semaine plus tard, l'équipe a pu rendre le modèle deux fois plus rapide avec une qualité au 97e centile, presque identique aux évaluations. Bien qu'il y ait une légère perte de qualité perceptible, H3 Max Turbo peut générer une vidéo de 5 secondes en 1,5 seconde, et ce, à un coût deux fois moindre. Aujourd'hui, ces modèles sont si abordables et rapides que l'équipe estime que les utilisateurs n'ont pas besoin de plus de vitesse ou de prix réduits. L'accent est désormais mis sur l'amélioration de la qualité et de la contrôlabilité des modèles.
La contrôlabilité est essentielle. Après le texte vers vidéo et l'image vers vidéo, les références sont devenues un mode d'utilisation par défaut, ajoutant une grande contrôlabilité. L'équipe ajoute également différentes versions fines de Laura au modèle de base, travaille sur une version de synchronisation labiale, et des Laura pour différents angles de caméra et styles. L'open source favorise un écosystème entier autour du modèle.
Le lancement de H3 Max a été une surprise même pour l'équipe, notamment l'adoption rapide et l'utilisation en temps réel sur Twitch. Les résultats des évaluations internes, qui ont coûté des dizaines de milliers de dollars, étaient si bons qu'ils ont attendu la validation externe avant de le lancer. L'entreprise a été prise d'une effervescence créative, avec des ingénieurs se lançant dans de nouvelles applications. Par exemple, un ingénieur a diffusé en direct des générations continues de H3 Max depuis son ordinateur portable sur Twitch. En parallèle, un influenceur Twitter, Level Zio, a eu une idée similaire et a créé un site web pour héberger un streaming infini.
En interne, l'équipe ML travaillait sur une version continue de H3 Max avec des transitions plus fluides et une mémoire allant jusqu'à 2 minutes, permettant des scènes continues. Une autre équipe travaillait sur une expérience appelée "Fal Live" pour cette version continue. Ces trois efforts parallèles sont devenus viraux indépendamment.
La capacité à rendre le modèle plus continu a été particulièrement surprenante. L'équipe s'est concentrée sur les modèles de rôle et les flux vidéo continus en temps réel contrôlés par l'action. Auparavant, la qualité était insuffisante, mais l'infrastructure a été développée pour diffuser des vidéos, les contrôler en temps réel avec une faible latence, et les multiplexer pour plusieurs utilisateurs. L'équipe ML a appliqué des optimisations pour générer des vidéos plus longues (15, 30 secondes) mais toujours en dessous du temps réel. Lorsque H3 Max a débloqué la génération en temps réel (5 secondes en moins de 5 secondes), l'équipe ML a pu appliquer ses connaissances pour étendre la mémoire jusqu'à 2 minutes. Cela a nécessité des optimisations très astucieuses en raison de la complexité de l'attention sur une vidéo de 2 minutes, qui augmente exponentiellement en termes de calcul.
Le modèle H3 Max Director, public, peut générer des vidéos continues jusqu'à 60 minutes, contrôlées par l'action. L'utilisateur peut commencer par une invite, par exemple un bureau, puis 30 secondes plus tard, ajouter une femme entrant par la porte, et le modèle l'intègre immédiatement. Le bureau reste le même, et la caméra peut revenir à la personne d'origine. Le site web "Fal Live" a été créé pour démontrer cette technologie, permettant aux utilisateurs de voter pour la prochaine action, ce qui a généré un engagement viral. Des chaînes thématiques ont été créées, démontrant la capacité du modèle à se souvenir de nombreux concepts et styles.
Le marché des médias génératifs est caractérisé par des périodes de calme suivies de bursts d'innovation. H3 Max, avec sa capacité à réduire la latence, offrir une expérience en temps réel et une contrôlabilité, ouvre de nombreuses opportunités pour des expériences en direct où l'utilisateur final peut contrôler ce qui se passe à l'écran.
En seulement trois semaines, H3 Max est devenu le modèle vidéo le plus populaire sur la plateforme Fal, doublant presque le volume d'utilisation. Il devient également un modèle par défaut sur d'autres plateformes en raison de sa rapidité et de son coût. Pour H3 Max Director, il existe des dizaines de versions de flux en direct, certaines devenant de plus en plus populaires. L'équipe collabore avec des détenteurs de propriété intellectuelle d'IA pour créer des versions en direct de leurs émissions. La possibilité de diriger le modèle par la voix, comme un réalisateur de cinéma, est déjà utilisée par les ingénieurs créatifs.
La mémoire du modèle ne se limite pas aux images ou au texte. Il se souvient de la vidéo brute, très compressée, pour les 2 premières minutes, avec des détails précis. Au-delà de 2 minutes, il utilise une invite système évolutive qui maintient la cohérence globale du monde jusqu'à 60 minutes.
Sur le plan économique, H3 Max réduit considérablement les coûts de service. Les modèles vidéo sont complexes, avec différents composants nécessitant parfois des configurations matérielles différentes. Pour une efficacité encore plus grande, différentes parties du pipeline pourraient être exécutées sur différents types de matériel. L'exécution sur du matériel grand public à domicile est également une possibilité.
Le modèle H3 Max a un impact significatif sur l'industrie cinématographique. Le flux de travail consistant à utiliser Blender pour rendre une scène en basse résolution, puis à utiliser cette vidéo comme référence pour un modèle d'IA afin d'obtenir une contrôlabilité proche de 100%, est très populaire auprès des artistes VFX. La combinaison de GPT Astra (un modèle LLM) pour créer une scène Blender, puis de la passer à H3 Max, a débloqué un tout nouveau pipeline pour Hollywood. La vitesse de H3 Max permet d'expérimenter de nombreuses options en parallèle.
L'équipe se concentre désormais sur l'ajout de contrôlabilité aux modèles pour les professionnels. Des avancées incluent un modèle de synchronisation labiale (fournissant l'audio et une référence vidéo ou image), des contrôles de mouvement (appliquant la danse de quelqu'un à un personnage généré par l'IA), et des contrôles de caméra. Ces derniers permettent de diriger précisément la caméra dans la vidéo via une description structurée (JSON), garantissant que le modèle adhère parfaitement à ces instructions