
Généalogie des grands modèles de langage
Audio Summary
AI Summary
Le présentateur entame son exposé sur les origines des grands modèles de langage (LLM) en remontant jusqu'à GPT-1, le premier modèle d'OpenAI en 2018, loin de l'attention médiatique focalisée sur ChatGPT et ses successeurs. Il souligne que l'objectif initial de la recherche n'était pas de créer des machines capables de générer du texte de manière générale, mais visait des buts beaucoup plus modestes, faisant de la capacité de GPT-2 à générer du texte fluide et cohérent un choc imprévu.
Pour appréhender ce choc, l'orateur définit le langage humain selon trois critères essentiels : la production de séquences de mots inédites, cohérentes et adaptées à une large diversité de contextes. La plupart des gens associent l'intelligence à la maîtrise du langage, un critère repris par le test de Turing. Avant 2019, aucun système informatique ne cochait ces trois cases simultanément. Les algorithmes d'autocomplétion basiques produisaient du texte inédit et contextuel, mais incohérent. Les traducteurs automatiques étaient cohérents et contextuels, mais non inédits. Les chatbots comme Cleverbot copiaient des extraits, donc non inédits, et manquaient de cohérence sur la durée. Les êtres humains étaient, jusqu'alors, les seuls à maîtriser pleinement ces trois aspects.
L'historique des LLM remonte à 2011 avec un article d'Ilya Sutskever, James Martens et Geoffrey Hinton. Leur modèle, entraîné à prédire le caractère suivant d'un texte Wikipédia, visait à améliorer la compression de fichiers. Les auteurs y émettent l'idée spéculative qu'atteindre la limite asymptotique de la compression de texte requiert une compréhension équivalente à l'intelligence. Leur modèle, le plus grand et le plus profond réseau de neurones récurrent de l'époque, générait du texte qui, bien qu'anglais et texturé, manquait de cohérence au-delà de quelques mots, ne cochait que les critères d'inédit et de sensibilité au contexte. Cependant, les auteurs furent surpris par la structure linguistique intéressante et de haut niveau qu'il avait appris, comme l'équilibrage des parenthèses sur de longues distances, sans règles explicites. Ils prévoyaient que des modèles plus grands pourraient atteindre de meilleures performances.
L'avènement du deep learning, popularisé par l'article AlexNet en 2012, marqua une étape cruciale. Si le deep learning excellait dans la reconnaissance d'images grâce aux réseaux convolutifs, son application au langage naturel nécessitait des architectures différentes, notamment les réseaux de neurones récurrents (RNN). En 2016, un modèle d'un milliard de paramètres était entraîné à la prédiction de prochain mot sur un corpus de "1 Billion Word" composé de phrases aléatoires d'articles de presse, limitant l'apprentissage au-delà de la phrase. La métrique principale était la perplexité. En 2017, des modèles de "plus de cent milliards de paramètres" furent explorés avec l'architecture "mixture of experts", mais la génération de texte restait une curiosité, la perplexité étant toujours la métrique de performance privilégiée.
La publication en juin 2017 de "Attention is All You Need" par des chercheurs de Google introduisit l'architecture Transformer, qui révolutionna le traitement du langage naturel. Contrairement aux RNN qui traitaient les mots séquentiellement avec une mémoire limitée, les Transformers utilisaient un mécanisme d'"attention" permettant à chaque mot d'accéder directement à n'importe quel autre mot dans la fenêtre de contexte, résolvant les problèmes de dépendances à longue distance et facilitant la parallélisation. Cette architecture est la base de tous les LLM actuels. Cependant, l'article initial testait les Transformers sur la traduction automatique, et non sur la génération de texte.
En octobre 2018, Google publia BERT, un modèle Transformer bidirectionnel entraîné à "remplir des textes à trous". Cette approche, qui considérait le contexte des deux côtés du mot à deviner, améliora considérablement les performances en compréhension du langage naturel, surpassant GPT et devenant la référence en 2019. Les tâches de compréhension testées étaient principalement de classification, ne nécessitant pas de génération de texte.
Le premier modèle de type Transformer d'OpenAI, publié en 2018 et plus tard appelé GPT-1, fut entraîné sur le corpus BooksCorpus, contenant des livres entiers pour permettre l'apprentissage de dépendances à longue portée. Il fut pré-entraîné à la prédiction de prochain mot, mais son objectif principal était de servir de base pour un "fine-tuning" ultérieur sur des tâches de compréhension, où il obtint des résultats prometteurs. La génération de texte par GPT-1 restait incohérente au-delà de quelques phrases, bien que les auteurs aient noté la capacité du modèle à générer du texte inédit et contextuel.
En 2019, OpenAI publia GPT-2, un modèle Transformer dix fois plus grand (1,5 milliard de paramètres) entraîné sur le corpus WebText, constitué de pages Reddit. À la surprise générale, GPT-2 démontra une capacité inédite à générer du texte cohérent sur plusieurs paragraphes, inédit et adapté au contexte, remplissant ainsi les trois critères du langage humain. Cette performance, bien que non recherchée explicitement, émergea comme un effet secondaire de l'augmentation de l'échelle et de la qualité des données. L'article présentant GPT-2 soulignait que le modèle était un "apprenant multitâche non supervisé", capable de réaliser diverses tâches sans fine-tuning spécifique, grâce à son pré-entraînement sur un corpus large et diversifié. L'incertitude quant aux capacités du modèle et aux risques d'usages malveillants conduisit OpenAI à une publication progressive, d'abord une version réduite, puis le modèle complet en novembre 2019, suscitant des débats sur la publication responsable des IA.
La trajectoire vers des modèles toujours plus grands, portée par l'hypothèse du "gros blob de calcul" et la leçon de Richard Sutton sur l'importance de l'exploitation de la puissance de calcul, mena à GPT-3 en 2020, un modèle de 175 milliards de paramètres. GPT-3 marqua un nouveau bond en qualité, dépassant GPT-2 et s'imposant comme un système d'IA majeur, capable de performances impressionnantes dans diverses tâches, y compris la génération de texte, la traduction, et même des raisonnements complexes. L'arrivée de ChatGPT, puis de GPT-4, a normalisé ces capacités qui semblaient impossibles quelques années auparavant, redéfinissant la perception du langage et de l'intelligence artificielle, et ouvrant la voie à des avancées rapides dans des domaines comme les mathématiques et la philosophie. Le présentateur conclut en soulignant le vertige de cette transition historique et l'importance de ne pas s'habituer à ces avancées, mais de continuer à s'étonner de la capacité des machines à parler.