
Former Intel CEO: Why This is the Best Time to Build Hardware
Audio Summary
AI Summary
Dans un débat sur l'avenir de la technologie, Pat Gelsinger, ancien PDG d'Intel et de VMware, et actuel associé chez Playground Global, discute avec les animateurs des défis et des opportunités de l'ère de l'IA.
Gelsinger commence par évoquer son parcours chez Intel, où il a commencé à 16 ans grâce à une bourse, intégrant l'entreprise à 18 ans. Il a rapidement gravi les échelons, passant de technicien à ingénieur sur le 286, puis architecte et responsable de la conception du 386 et du 486, tout en poursuivant ses études. Il raconte des anecdotes sur ses interactions avec ses professeurs de Stanford, qu'il défiait avec ses expériences pratiques sur les puces, soulignant l'interaction unique entre l'académie et l'industrie dans la Silicon Valley.
Le 486 est présenté comme une réalisation majeure, non seulement pour ses avancées en microprocesseur, mais aussi parce qu'il a été le premier à utiliser des techniques de conception assistée par ordinateur (CAO) modernes. L'équipe a dû inventer son propre langage de description matérielle (HDL) et son compilateur, ainsi que les premières méthodes automatisées de placement, de routage et de gestion du timing, en collaboration avec des chercheurs de Berkeley. Cela a jeté les bases de l'industrie moderne de la CAO.
Aujourd'hui, Gelsinger voit une transition similaire avec l'IA. Des outils comme "Jalapeno" (nom d'un outil de conception IA) représentent une utilisation des "premiers principes" de l'IA dans la conception de puces. Bien que certaines parties, comme la conception analogique, restent difficiles pour l'IA, de nombreuses fonctions logiques peuvent désormais être réalisées par des outils d'IA. Il prédit que l'on regardera le Blackwell (une architecture GPU d'Nvidia) comme la dernière génération conçue avant que l'IA ne domine le processus de conception de puces.
Cependant, Gelsinger identifie de nouveaux goulots d'étranglement qui émergent à mesure que la conception devient plus facile grâce à l'IA. Le premier est le temps de fabrication du silicium. Même avec une conception rapide en trois mois, il faut neuf mois pour obtenir des puces réelles à grande échelle, y compris l'emballage avancé (comme les boîtiers 3D) et l'intégration en rack. Il appelle à de nouvelles formes de lithographie et à des flux de conception qui réduisent les coûts de masquage pour compresser ce cycle à un ou deux mois. Sans cela, la compréhension des charges de travail d'IA sera obsolète au moment où la puce sera prête. Il cite l'exemple de Graphcore, dont la conception n'était pas mauvaise, mais le monde a évolué trop vite.
Le deuxième goulot d'étranglement majeur est la mémoire. Gelsinger qualifie l'HBM (High Bandwidth Memory) de "mémoire hideuse", malgré sa domination actuelle. Elle souffre d'une faible densité binaire, de limitations de bande passante, de problèmes de puissance et de thermique. L'IA étant une charge de travail intensive en mémoire, il est crucial d'améliorer la mémoire. Il souligne le manque d'innovation majeure en matière de mémoire depuis 30 ans, en partie à cause de la faible rentabilité historique de l'industrie. Cependant, la situation a changé, et les trois principaux fournisseurs de mémoire figurent désormais parmi les 20 entreprises les plus valorisées au monde. Gelsinger est optimiste quant à une innovation imminente en matière de mémoire, en particulier avec l'intégration de la mémoire et du calcul (empilement 3D) et l'exploration de nouveaux matériaux comme les ferroélectriques.
Le troisième goulot d'étranglement est la puissance et la dissipation thermique. Les outils de simulation de puissance actuels sont insuffisants, entraînant une perte d'environ 40 % de la puissance par des marges de sécurité. Il faut de meilleurs modèles de puissance et des techniques de dissipation plus efficaces.
Concernant la prolifération des puces d'accélération d'inférence d'IA, Gelsinger estime que les "cent" fournisseurs actuels ne sont qu'un phénomène temporaire. Il prédit une convergence vers un nombre plus restreint d'architectures pour trois raisons principales. Premièrement, la spécialisation extrême des architectures pour des portions spécifiques de la charge de travail (pré-remplissage, remplissage intermédiaire, etc.) n'est pas durable, car les charges de travail d'IA évoluent rapidement et nécessitent une plus grande généralisation. Deuxièmement, la plupart de ces entreprises ne parviendront pas à atteindre l'échelle et le capital nécessaires pour réussir. Troisièmement, les grands acteurs comme OpenAI et Nvidia finiront par choisir les plateformes gagnantes, qui nécessitent des investissements importants dans le logiciel et l'évolution des charges de travail.
Interrogé sur la possibilité d'une hétérogénéité accrue grâce à la facilité de programmation des puces avec l'IA (où les agents peuvent écrire des noyaux optimisés), Gelsinger reconnaît que cela change la donne pour les logiciels, mais les contraintes de fabrication à grande échelle et les coûts d'investissement massifs (des dizaines de milliards de dollars pour les centres de données et les GPU) limiteront la diversité. Les grands acteurs pourront masquer l'hétérogénéité sous des couches d'abstraction, mais la construction à l'échelle reste difficile.
Sur l'empilement de puces, Gelsinger ne croit pas aux piles de 16 ou 32 couches en raison des défis de rendement exponentiels. Il anticipe plutôt un "sweet spot" autour de trois, quatre ou cinq couches. Il souligne également la nécessité d'intégrer l'alimentation et la connectivité optique dans ces structures 3D complexes, ce qui représente un défi d'ingénierie et un "cauchemar de fabrication".
En ce qui concerne la connectivité optique, Gelsinger a "déclaré la mort du cuivre" il y a 25 ans et pense que toutes les fonctions d'E/S devraient passer à l'optique. La physique actuelle pousse vers cette transition, car le cuivre devient plus cher que l'optique sur de courtes distances. Cependant, la chaîne d'approvisionnement optique n'est pas encore mature à l'échelle requise (des millions de GPU). Il estime que 2028-2029 sera le point de conversion, car les grands clusters d'IA ne pourront pas évoluer sans cette transition. Il critique l'NVL72 (un système Nvidia) comme un "miracle d'ingénierie et un cauchemar de fabrication", qui aurait été plus avancé avec une chaîne d'approvisionnement optique mature.
Concernant l'architecture réseau, Gelsinger, citant Nick McKeown, estime que les réseaux d'IA, avec leurs flux larges et prévisibles, se rapprochent davantage des réseaux commutés par circuit que des réseaux par paquets. Il prédit une convergence vers la commutation optique par circuit (OCS) pour gérer ces flux prévisibles et l'intégration de l'optique dans le complexe de calcul.
Enfin, Gelsinger aborde la question cruciale de la capacité énergétique. Il déplore que les États-Unis aient fait un "travail terrible" en matière de capacité énergétique, avec une croissance nulle pendant 10 à 15 ans. Dans l'ère numérique de l'IA, "la capacité énergétique équivaut à la capacité économique". Il prédit davantage de défauts sur les projets de centres de données en raison du manque d'énergie. Il appelle à une augmentation rapide de la capacité énergétique, en particulier le nucléaire, et à une plus grande efficacité dans les réseaux de distribution, comme l'adoption de centres de données 800 volts DC pour éliminer les étapes de conversion inefficaces. Il voit un "renaissance" pour les ingénieurs hardware, avec des innovations dans la conversion de puissance (comme le GAN vertical) et de nouvelles physiques, comme la supraconductivité, pour améliorer radicalement la performance énergétique des puces.
En conclusion, Gelsinger réaffirme l'importance de l'abstraction logicielle, même à l'ère de l'IA. Les machines virtuelles, qu'elles soient gérées au niveau de l'infrastructure ou de l'application, restent un modèle fondamental. Il imagine un "VMware pour agents", où chaque aspect de la virtualisation et de la gestion doit être réinventé pour servir les agents plutôt que les humains et le matériel, en se concentrant sur la sécurité, la performance, l'abstraction et la migration des agents, tout en permettant aux humains de définir les politiques et les "constitutions" pour ces agents.