
Saturday Vibe Coding: Testing New Releases + Q&A
Audio Summary
AI Summary
Lors d'une session en direct, Jesse, CTO, et le présentateur ont discuté des nouvelles versions de Google, notamment Gemini, et ont répondu aux questions des spectateurs. La discussion a débuté par une analyse de la présentation "Gemini at work", soulignant l'intégration de l'IA dans les opérations de Google.
Gemini 4 Argon est un modèle puissant qui excelle dans les flux de travail complexes, comme le travail de connaissance, l'ingénierie logicielle et la cybersécurité. Il améliore la qualité et la vitesse de la programmation, permettant à Google de générer des millions de lignes de code en quelques semaines. Ce modèle est également utilisé pour améliorer Chrome, en rendant les pages web plus fluides et en réduisant les plantages. Dans le domaine de la cybersécurité, Argon est déjà utilisé pour protéger les infrastructures critiques, ayant même découvert et corrigé une vulnérabilité dans un logiciel de santé mondial. Les clients de Google Cloud qui ont testé Gemini 4 Argon ont salué sa capacité à traiter de grandes quantités de données non structurées et à exécuter des flux de travail d'entreprise complexes.
Gemini Enterprise, lancé l'année dernière, est une plateforme pour la création d'agents. Près de 90 % des entreprises du Fortune 100 l'utilisent, ainsi que des milliers de startups et de petites entreprises. Gemini est en train de devenir un agent universel pour le travail, capable de répondre à des questions, d'écrire du code et d'accomplir des tâches complexes. Il comprend l'organisation et intègre la sécurité, l'administration et la gouvernance requises par l'entreprise. L'approche de Google est de déployer d'abord ces agents puissants auprès des entreprises pour résoudre les problèmes de sécurité, d'échelle et de performance avant de les proposer aux consommateurs.
Thomas Kurian, PDG de Google Cloud, a souligné l'impact de Gemini sur le monde du travail. Nokia a réduit le temps de dépannage de son réseau de 80 %, Commerce Bank a amélioré l'assurance qualité des documents, et les agents de données de la fabrication ont réduit le temps entre la collecte de données et l'analyse de deux semaines à l'instantané, économisant 450 000 heures par an. Gemini est présenté comme un agent unique qui répond aux questions, effectue le travail de connaissance, gère les images et les médias, et écrit et exécute du code, le tout dans une seule interface. Il peut être assigné à des tâches ou démarrer en fonction d'un événement. Contrairement à d'autres fournisseurs où le chat et le code sont dans des onglets séparés, Gemini gère tout dans une seule fenêtre, conservant l'historique des conversations.
Lorsque la tâche est trop grande pour un seul agent, Gemini peut créer dynamiquement une équipe d'agents, leur assigner des tâches, communiquer directement avec eux et les coordonner jusqu'à l'achèvement du travail. Gemini fonctionne dans l'application Gemini, Google Workspace, Slack et Microsoft Office, conservant un enregistrement unique des informations. Plus on travaille avec lui, mieux il connaît l'utilisateur et ses méthodes de travail. Il hérite également des contrôles de sécurité existants. Un point crucial est que Gemini n'est pas lié à un seul modèle ; il est l'agent, et le modèle sous-jacent est un choix distinct, permettant aux utilisateurs d'utiliser des modèles comme Argon, Flash, ou d'autres modèles propriétaires ou open source.
L'un des principaux défis que Google tente de résoudre est la gestion du contexte. Si Gemini peut gérer intelligemment plusieurs conversations, créer des agents spécialisés et orchestrer le travail, cela résoudrait un problème majeur pour de nombreuses personnes et entreprises. Google, en tant que fournisseur d'infrastructure et de services cloud, a un avantage en offrant la flexibilité d'utiliser divers modèles, y compris des modèles open source, et de monétiser l'inférence.
Un exemple concret a montré comment Gemini peut créer une présentation PowerPoint, un modèle de revenus et une vidéo de produit. L'agent comprend l'objectif, élabore un plan et crée des sous-agents. L'utilisateur peut choisir le modèle à utiliser (mode automatique ou modèles spécifiques), joindre des fichiers ou des dossiers, et même des projets. Les "compétences" sont des instructions simples ou des référentiels que l'utilisateur peut créer. Gemini peut également générer des vidéos grâce à Omni, leur nouveau modèle de génération vidéo.
Dans Google Workspace, Gemini peut fonctionner comme un collègue, avec son propre compte Workspace, son adresse e-mail et son propre contexte. Il peut être tagué, envoyé par e-mail et partagé. Par exemple, un agent d'événements peut être tagué dans un chat de groupe pour obtenir de l'aide sur un lancement régional, accédant au contexte de travaux antérieurs pour fournir un résumé et une évaluation des risques. Il peut également modifier des documents en fonction des commentaires, prouvant sa capacité à collaborer de manière autonome.
L'intégration profonde de Gemini avec Google Workspace est un atout majeur. Alors que d'autres plateformes comme Notion offrent une interface utilisateur plus propre, l'intégration native de Google avec Drive, Docs, Chat et Calendar, ainsi que la capacité à utiliser des modèles tiers, sont des avantages considérables. Cela permet aux entreprises de ne pas être enfermées dans un seul fournisseur de modèles, une préoccupation majeure pour de nombreux utilisateurs d'IA.
Pour les entreprises, la transition vers ces systèmes d'IA peut être complexe. Il a été suggéré que les consultants en IA pourraient jouer un rôle crucial en aidant les entreprises à comprendre et à intégrer ces plateformes, plutôt que de les pousser vers des solutions personnalisées ou d'autres plateformes. La formation des équipes à l'utilisation de ces systèmes est également un aspect essentiel.
Gemini permet de créer des micro-sites interactifs sans écrire une seule ligne de code, en utilisant simplement le langage naturel pour décrire le résultat souhaité. Cela est particulièrement utile pour les logiciels à usage unique ou à court terme. Il peut également déployer ces micro-sites en production. Au-delà de l'interface graphique, Gemini peut fonctionner via la ligne de commande (CLI), créant une équipe dynamique de sous-agents, utilisant des compétences pour lire des feuilles de calcul, connecter des données et écrire du code. Il peut tester et déboguer le système, et maintenir les données à jour.
Un aspect crucial est la personnalisation. Gemini apprend les préférences de l'utilisateur, comme le style de communication, et peut adapter ses réponses en conséquence. Par exemple, il peut lire les nouveaux e-mails chaque matin et rédiger des réponses, apprenant du style de l'utilisateur au fil du temps.
La gouvernance est également une priorité. Gemini offre une visibilité et un contrôle complets sur l'activité des utilisateurs et des agents. Chaque agent a une identité unique, et un système de traçabilité permet de voir exactement ce qu'un agent a fait. Des politiques peuvent être mises en place pour bloquer le partage de données sensibles ou exiger un examen humain pour les e-mails externes. Cela représente une opportunité pour les consultants en IA d'aider les entreprises à définir et à mettre en œuvre ces politiques.
Google a également mis l'accent sur la gestion des coûts. Les prix des jetons ont chuté de 98 % depuis 2024, mais les dépenses en IA augmentent en raison du volume d'utilisation. Gemini aide à optimiser les coûts de trois manières : en choisissant le bon modèle pour chaque tâche (le plus grand n'est pas toujours le meilleur), en utilisant un routage intelligent qui commence par des modèles moins chers et n'escalade vers des modèles plus grands que si nécessaire, et en permettant de définir des plafonds de dépenses en temps réel par projet. Ces plafonds couvrent le coût des jetons, des sandboxes de code et des machines de calcul, permettant de refacturer les coûts aux différents départements.
La puissance de Gemini repose sur deux couches invisibles : le silicium et l'intégration complète de la pile. Google conçoit la puce, l'interconnexion, le centre de données et le logiciel comme un seul système, optimisant le routage des charges de travail du matériel vers le haut. Cela permet aux agents de routine de fonctionner avec un minimum de frais généraux.
Google propose également des agents Gemini spécialisés pour des industries spécifiques, comme les services financiers et le droit, avec des connecteurs, des compétences et des agents adaptés à chaque secteur. Par exemple, Gemini pour les services financiers peut analyser rapidement l'impact d'une nouvelle sur un fonds d'investissement, vérifier la conformité et recommander des transactions. Dans le domaine juridique, il peut automatiser le travail complexe et la réduction d'informations confidentielles.
L'intégration de Gemini avec les systèmes d'information des entreprises est également mise en avant. Il peut interroger Amazon S3 et Azure Data Lake, lire Salesforce, SAP et ServiceNow sans copier de données. Il fédère également Open Iceberg sur diverses plateformes de données. Cela permet aux entreprises de bénéficier de l'IA sans déplacer leurs données existantes.
Enfin, Google s'engage à offrir une plateforme pérenne, à éliminer la complexité en intégrant toute la pile (agent, outils, compétences, modèles, silicium, contrôles) et à garantir que les créations des utilisateurs leur appartiennent. Un écosystème de partenaires et de solutions tierces est disponible pour aider les entreprises à déployer Gemini.
En résumé, Google Gemini est présenté comme une plateforme d'IA complète et puissante, capable de transformer le travail en entreprise grâce à des agents universels et spécialisés, une intégration profonde avec les outils existants, une gestion intelligente du contexte et des coûts, et des fonctionnalités avancées de gouvernance et de personnalisation. Son approche flexible en matière de modèles et son écosystème de partenaires en font une solution prometteuse pour les entreprises de toutes tailles.