
I Gave ChatGPT Images 2.5 Some VERY Weird Prompts
Audio Summary
AI Summary
Bienvenue sur la chaîne Matt Vid Pro. Image Gen 2.5 d'OpenAI est arrivé et représente une nette amélioration, comme le montrent de nombreux exemples. L'une des utilisations les plus uniques et fascinantes observées est la création d'animations en stop motion. Ivana a présenté un petit dragon éclosant d'un œuf, dans un style "claymation". Le dragon crache du feu, démontrant la capacité du modèle à comprendre la séquence des événements. Des améliorations significatives ont été apportées à sa capacité à interpréter une image générée et à anticiper les actions suivantes, le rendant apparemment beaucoup plus intelligent.
Une comparaison directe avec GPT Image 2, réalisée par Angel, révèle que 2.5 est considérablement plus fluide, soulignant un travail important sur la cohérence de l'édition. Gabriel a généré une animation de Will Smith mangeant des spaghettis, qui, malgré sa non-vocation à cette tâche, est étonnamment cohérente. On observe que la première image générée offre la meilleure qualité, avec une légère dégradation par la suite.
J'ai moi-même testé le stop motion en demandant à Codex de générer des images pour une animation Lego où Matt Vid Pro, tel Indiana Jones, fuit un citron géant. Le résultat, bien qu'imparfait, est cohérent. Le modèle est également devenu plus rapide et plus efficace pour intégrer des références web, permettant de générer des images me ressemblant assez fidèlement, même si une demande explicite de ne pas utiliser le web produit des résultats moins précis.
Un autre modèle, Nano Banana, surnommé Spicy Mayo, est en préparation et promet d'être compétitif. Lors d'un test de capture d'écran Minecraft, Spicy Mayo a surpassé Nano Banana 2, avec un rendu plus précis du chameau, de la barre d'accès rapide, du corail et de l'océan. Néanmoins, Images 2.5 a également très bien performé sur le même prompt, avec une barre d'accès rapide presque parfaite et un chameau encore meilleur que celui de Spicy Mayo. Les nuages sont moins réussis, mais les deux modèles semblent plus proches qu'on ne le pense.
Les utilisateurs de mon serveur Discord ont partagé leurs créations. Rorow Tuck, un modérateur connu pour son style réaliste et percutant, a généré des images impressionnantes. Par exemple, un homme tronçonnant une fontaine de chocolat de six étages. Bien que Images 2.0 ait produit des résultats similaires, le 2.5 montre des détails plus fins, malgré quelques incohérences anatomiques. Une autre image met en scène un cerf dans un caddie devant un McDonald's, très convaincante, avec des détails comme le flash dans l'œil du cerf.
Rorow a également noté une obsession du modèle pour les toilettes, y plaçant un chat même sans mention explicite dans le prompt. D'autres créations incluent un Teletubby SDF fouillant un réfrigérateur, une image terrifiante, et une créature banane avec un raton laveur, démontrant la capacité du modèle à l'abstraction.
TJ, un autre membre du serveur, a créé une scène de cours d'informatique des années 80/90, très détaillée et crédible, avec des écrans différents pour chaque personne et des éléments lisibles comme des livres et un tableau. Une capture d'écran de Runescape, avec un "corbillard" comme boss final, est incroyablement fidèle à l'interface du jeu. Une autre version de ce corbillard, mais vivant, est à la fois hilarante et perturbante.
La nouvelle fonctionnalité "sketch" de ChatGPT permet de transformer des croquis rudimentaires en peintures à l'huile cohérentes et magnifiques. Luigi von Doom l'a utilisée pour un chat et un poisson. Une image générée par "random select" me représente achetant des "citrons liquides illégaux" dans un style jeu South Park.
J'ai testé l'édition d'images avec un livestream Twitch d'un poulet sculptant une lanterne ananas avec des bras bioniques, le tout dans une décapotable sur une piste de course. Le résultat est impressionnant : le screenshot est presque parfait, avec des détails comme les bras bioniques fonctionnant et une marque de boisson énergisante fictive. Les commentaires sous la vidéo sont également fidèles à l'ambiance d'un livestream.
Un autre test a porté sur un organigramme pour cultiver une citrouille de 2 000 livres. L'organigramme est précis et correct, décrivant les étapes clés du processus. J'ai ensuite augmenté la complexité avec un organigramme de "sabotage de concurrents", me représentant comme un méchant citron. Bien que le design soit cool, l'image présente le motif récurrent des images GPT d'OpenAI, suggérant une signature de génération IA.
L'art abstrait pour décrire le goût chimique de l'eau du robinet d'un restaurant est incroyablement bien réalisé, combinant le visage avec l'eau pour transmettre l'idée. Une légère modification a rendu l'eau encore plus "chimique". L'organigramme de sabotage de citrouilles rivales, bien que amusant, révèle des problèmes de logique, avec des "oui" et "non" inversés et des boucles infinies, montrant que les organigrammes complexes restent un défi.
Un test d'édition d'une image de moi sur une balançoire géante a révélé la difficulté du modèle à corriger des détails structurels comme le nombre de câbles. Malgré des tentatives répétées et des commentaires positionnels, le modèle a eu du mal à connecter les éléments de manière symétrique et logique. La qualité de la première image reste supérieure, avec une légère dégradation lors des modifications successives.
En conclusion, Images 2.5 est une amélioration par rapport à 2.0, surtout pour les utilisateurs réguliers qui apprécieront son intelligence accrue et sa meilleure compréhension des prompts complexes. L'édition est améliorée mais pas encore parfaite, et le problème des motifs hallucinatoires ainsi que le filtre teinté de jaune persistent. Bien qu'il ne s'agisse pas d'un bond générationnel majeur, c'est une version plus aboutie.