Hyung Won Chung, un chercheur accompli en IA qui était auparavant employé par Google Brain et qui est actuellement membre de l’équipe OpenAI, a prononcé un discours stimulant de 45 minutes dans lequel il a exploré le monde des grands modèles de langage en 2023. Chung a de l’expérience dans le domaine ; il a été le premier auteur de l’article de Google « Scaling Instruction-Finetuned Language Models », qui examine comment les grands modèles de langage peuvent être formés pour suivre des instructions.
Hyung Won Chung, OpenAI
Chung souligne que le monde des modèles linguistiques extensifs est dynamique. Dans le monde des LLM, le principe directeur évolue constamment, contrairement aux domaines traditionnels où les hypothèses fondamentales restent généralement stables. Avec la prochaine génération de modèles, ce qui est actuellement considéré comme impossible ou irréalisable pourrait devenir possible. Il souligne l’importance de préfacer la plupart des affirmations sur les capacités des LLM par « pour l’instant ». Un modèle peut effectuer une tâche, mais il ne l’a pas encore fait.
Les grands modèles d'aujourd'hui seront des petits modèles dans quelques années seulement
Hyung Won Chung, OpenAI
La nécessité d’une documentation et d’une reproductibilité méticuleuses dans la recherche en IA est l’une des leçons les plus importantes à tirer du discours de Chung. Il est essentiel de documenter minutieusement les travaux en cours au fur et à mesure que le domaine se développe. Cette stratégie garantit que les expériences peuvent être rapidement reproduites et revisitées, ce qui permet aux chercheurs de s’appuyer sur les travaux antérieurs. Grâce à cette pratique, il est reconnu que des capacités peuvent se développer à l’avenir qui n’étaient pas pratiques lors de la recherche initiale.
Chung consacre une partie de son exposé à élucider les subtilités du parallélisme des données et des modèles. Pour ceux qui souhaitent approfondir les aspects techniques de l'IA, cette section fournit des informations précieuses sur le fonctionnement interne de ces techniques de parallélisme. La compréhension de ces mécanismes est essentielle pour optimiser la formation de modèles à grande échelle.
Chung avance que la fonction objective actuelle, la vraisemblance maximale, utilisée pour la préformation LLM constitue un obstacle lorsqu'il s'agit d'atteindre des échelles véritablement massives, telles que 10 000 fois la capacité de GPT-4. À mesure que l'apprentissage automatique progresse, les fonctions de perte conçues manuellement deviennent de plus en plus restrictives.
Chung suggère que le prochain paradigme dans le développement de l’IA consiste à apprendre des fonctions par le biais d’algorithmes distincts. Cette approche, bien qu’elle en soit à ses débuts, promet une évolutivité au-delà des contraintes actuelles. Il souligne également les efforts en cours, tels que l’apprentissage par renforcement à partir du feedback humain (RLHF) avec modélisation des règles, comme des pas dans cette direction, même si des défis restent à relever.
Selon un chercheur d’OpenAI, les grands modèles linguistiques d’aujourd’hui seront de petits modèles. L’article est apparu en premier sur Metaverse Post.
