
Building the Cloud for AI Agents | AWS CEO Matt Garman
Audio Summary
AI Summary
Le responsable général d'EC2, Adam Selipsky, s'entretient avec Adam Green, le premier responsable général d'EC2, pour discuter de l'évolution d'AWS, des startups et de l'impact croissant de l'IA. AWS a connu une croissance phénoménale, passant de son premier dollar de revenus à près de 170 milliards de dollars, avec une croissance de 37 % d'une année sur l'autre. Selipsky souligne que l'entreprise est encore à ses débuts, une grande partie des charges de travail restant sur site, et que la demande de puissance de calcul continue de croître, alimentée par l'IA et la migration vers le cloud.
Les startups ont toujours été le moteur d'AWS. Dès 2005, une analyse interne a identifié les startups comme les clients les plus probables, et cette relation est restée la pierre angulaire de leur activité. AWS offre une proposition de valeur attrayante aux startups, en leur fournissant non seulement une infrastructure, mais aussi des conseils sur l'architecture et la mise à l'échelle. Plus important encore, les startups d'aujourd'hui sont les entreprises de demain. On estime qu'entre 30 et 40 % des revenus d'AWS proviennent d'entreprises qui ont commencé comme des startups sur AWS. AWS apprend également des startups, car ce sont elles qui repoussent les limites de la technologie, poussant les services existants et demandant de nouvelles capacités qui anticipent les besoins futurs des grandes entreprises.
L'évolution des startups a entraîné des changements significatifs. Autrefois, les startups recevaient des financements modestes et développaient des idées progressivement. Aujourd'hui, elles sont valorisées à des milliards de dollars dès le départ, avec des financements considérables, ce qui se traduit par des ambitions et des idées plus importantes dès le départ. Cela s'accompagne d'un coût plus élevé pour l'entraînement de modèles et d'autres tâches gourmandes en calcul. Cependant, certains aspects n'ont pas changé : les startups ont toujours besoin de conseils sur l'architecture, la sécurité, les performances et la gestion des identités et des accès (IAM) pour pouvoir passer à l'échelle.
Une tendance notable est la demande croissante d'un cloud qui fonctionne bien avec les agents, et pas seulement avec les humains. AWS a optimisé ses services existants et en a développé de nouveaux pour répondre à cette demande. Des services comme Agent Core et Bedrock sont explicitement conçus pour les agents. AWS Context, actuellement en préversion, permet aux agents de trouver plus facilement des données sur différents services de données AWS. Les agents ont des exigences de performance uniques, notamment une faible latence et un débit élevé, ce qui amène AWS à se concentrer sur les latences de queue (P999) et d'autres métriques critiques pour les flux de travail des agents.
En réponse à la demande croissante des agents, AWS a repensé certains de ses services. Par exemple, les agents peuvent désormais créer des bases de données en quelques secondes, ce qui est différent des bases de données de production traditionnelles qui nécessitent une durabilité et une disponibilité élevées. AWS explore la manière de concilier la création rapide et l'élimination des ressources avec la nécessité de durabilité lorsque nécessaire. De nouveaux blocs de construction sont également développés, tels que les environnements d'exécution d'agents (compute sandboxes), les passerelles et des modèles de permission distincts pour les agents par rapport aux humains. Firecracker, la technologie de micro-VM d'AWS, est particulièrement adaptée à la création rapide d'environnements d'exécution sécurisés et légers pour les agents.
La demande de GPU est un défi majeur. AWS investit massivement dans l'expansion de sa capacité, avec un engagement d'achat de 2 millions de GPU NVIDIA dans les deux prochaines années, et un plan de dépenses d'investissement (capex) de 220 milliards de dollars pour 2026. Malgré cette expansion, la demande est massive, les principaux laboratoires d'IA capturant une grande partie des GPU disponibles. AWS s'engage à allouer des capacités aux startups, reconnaissant qu'elles sont les entreprises de demain. Ils parviennent à satisfaire environ 60 % des demandes des startups, souvent avec des délais ou des configurations légèrement différents.
Le capex d'AWS a considérablement augmenté ces dernières années, principalement en raison des besoins en IA. Si AWS a historiquement investi en avance sur la demande, la forte augmentation de la demande de GPU a limité l'élasticité des ressources. AWS est confiant dans ses investissements, citant sa stratégie de diversification, où aucun client ne représente une concentration excessive, et la nature fondamentale des services AWS qui alimentent les charges de travail de production. Ils prévoient que la demande d'IA ne diminuera pas, tout comme l'internet a persisté malgré le krach de la bulle Internet.
La planification d'AWS s'est considérablement étendue. Ils doivent désormais prévoir la demande des années à l'avance et s'occuper de choses comme la production d'énergie, la transmission et les chaînes d'approvisionnement complexes. AWS investit dans des projets d'énergie renouvelable et paie pour des projets d'alimentation pour assurer la capacité nécessaire. Ils suivent des centaines de milliers de composants et travaillent sur des plans d'approvisionnement à plusieurs années. Ce niveau de planification est une valeur ajoutée qu'AWS offre à ses clients, qui n'ont pas à s'en soucier eux-mêmes.
Concernant les centres de données, AWS reconnaît la nécessité d'être plus transparent sur leurs avantages pour les communautés. Ils mettent l'accent sur l'utilisation d'énergies renouvelables, leur faible consommation d'eau et la création d'emplois bien rémunérés. Ils pensent qu'une meilleure communication sur la manière dont les centres de données contribuent aux économies locales, par exemple en réduisant les impôts locaux, peut améliorer la perception publique.
AWS innove également dans la conception de ses propres puces. Le développement de Nitro a permis de virtualiser les fonctions réseau et de stockage, offrant des performances proches du métal nu et une meilleure isolation de sécurité. Cela a conduit à la création de processeurs ARM personnalisés, d'abord avec Graviton, qui offre une meilleure performance et un coût réduit, et maintenant avec Trainium pour l'entraînement et l'inférence de l'IA. Trainium, malgré son nom, est également très performant pour l'inférence et est utilisé dans Bedrock et par des clients comme OpenAI et Anthropic.
Les grandes entreprises adoptent les agents, mais leur utilisation est encore principalement non autonome et nécessite une intervention humaine. AWS encourage les entreprises à repenser leurs flux de travail plutôt que de simplement les répliquer avec des agents. La confiance et la sécurité sont des préoccupations majeures, les entreprises craignant que les agents ne commettent des erreurs coûteuses. AWS développe des services pour aider les entreprises à déployer des agents en toute sécurité, en mettant l'accent sur les autorisations, les environnements d'exécution et les garde-fous. Les entreprises ont besoin d'aide pour les systèmes d'évaluation (eval systems) et les boucles de test continues.
AWS est très favorable à la protection des données des entreprises. Bedrock garantit que les données des clients ne quittent jamais leur VPC et que les fournisseurs de modèles ne voient jamais leurs requêtes. Cela a conduit à une forte croissance de Bedrock, avec des charges de travail d'OpenAI et d'Anthropic qui migrent vers la plateforme. AWS propose également des modèles ouverts et des capacités pour l'entraînement et le réglage fin de ces modèles sur des données propriétaires, souvent dans SageMaker.
Face aux risques liés à l'IA, tels que les risques d'extension et les vulnérabilités de sécurité, les PDG s'inquiètent de la manière de faire confiance aux agents. AWS investit dans des capacités de déploiement sécurisé des agents, y compris des contrôles d'autorisation, des environnements d'exécution et des garde-fous. Ils développent également des solutions d'IA pour la sécurité, comme le service Continuum, qui utilise des modèles d'IA pour identifier et prioriser les vulnérabilités dans les environnements des clients, offrant ainsi une sécurité à la vitesse de la machine.
Au sein d'AWS, les agents sont utilisés intensivement. Amazon Quick, par exemple, a été déployé auprès de tous les employés d'Amazon, permettant aux équipes RH et financières de créer des agents pour automatiser des tâches complexes. Cela permet aux employés non techniques de résoudre des problèmes qui nécessitaient auparavant des développeurs et d'innover plus rapidement. L'impact sur la vitesse de développement logiciel et de produits est significatif, les équipes travaillant désormais dans une approche « agent d'abord ».
L'organisation interne d'AWS évolue également pour s'adapter à l'IA et aux agents. Ils expérimentent de nouvelles structures, comme des « pods », pour permettre aux équipes d'innover rapidement et de passer à de nouveaux projets. L'objectif est de rendre les employés plus autonomes et productifs, leur permettant de construire plus rapidement et de réaliser davantage.