Source de la réimpression de l'article : AI DreamWorks

Source de l'article : Xinzhiyuan

Deux chercheurs du MIT ont publié un article prouvant que les grands modèles de langage peuvent comprendre le monde ! Leurs travaux montrent que LLM apprend non seulement des statistiques superficielles, mais aussi un modèle du monde qui inclut des dimensions fondamentales telles que l’espace et le temps.

À l’intérieur du grand modèle linguistique, existe-t-il un modèle mondial ?

LLM a-t-il une sensation d'espace ? Et à plusieurs échelles spatio-temporelles ?

Récemment, plusieurs chercheurs du MIT ont découvert que la réponse est oui !

Adresse papier : https://arxiv.org/abs/2310.02207

Ils ont découvert que Llama-2-70B était réellement capable de représenter une carte littérale du monde réel des chercheurs.

Pour la représentation spatiale, les chercheurs ont appliqué le modèle Llama-2 aux noms de dizaines de milliers de villes, de régions et de monuments naturels à travers le monde.

Ils ont formé un détecteur linéaire lors de la dernière activation du jeton et ont découvert que Llama-2 peut prédire la véritable latitude et longitude de chaque lieu.

Pour la représentation temporelle, les chercheurs ont exécuté des modèles sur les noms de célébrités des 3 000 dernières années, les noms de chansons, de films et de livres depuis 1950 et les gros titres du New York Times des années 2010, et ont prédit avec succès des sondes linéaires. l'année de décès des célébrités, les dates de sortie des chansons, des films et des livres, ainsi que les dates de publication des actualités.

En bref, toutes les conclusions montrent que LLM n'est pas qu'un perroquet aléatoire : Llama-2 contient un modèle détaillé du monde. Il n'est pas exagéré de dire que les humains ont même découvert un « neurone de longitude » dans le grand modèle de langage !

Dès le lancement de ces travaux, ils ont reçu un accueil enthousiaste. L'auteur a retweeté le résumé du journal sur Twitter, et en moins de 15 heures il a été lu plus de 1,4 million de fois !

Les internautes se sont exclamés : Ce travail est incroyable !

Quelqu’un a dit : Intuitivement, c’est raisonnable. Parce que le cerveau distille notre monde physique et le stocke dans des réseaux biologiques. Lorsque nous « voyons » des choses, ce sont en réalité des projections que notre cerveau traite en interne.

C'est incroyable que vous ayez pu modéliser ça !

Certains partagent le même point de vue, suggérant que nous trompons peut-être le Créateur en essayant d’imiter le cerveau.

LLM n'est pas un perroquet aléatoire

Auparavant, de nombreuses personnes ont émis l'hypothèse que l'incroyable capacité du grand modèle de langage pourrait être simplement due au fait qu'il apprend un grand nombre d'ensembles de données statistiques superficielles, plutôt qu'au fait qu'il s'agit d'un modèle cohérent qui inclut le processus de génération de données (c'est-à-dire un modèle mondial). modèle) .

En 2021, la linguiste de l'Université de Washington, Emily M. Bender, a publié un article affirmant que les grands modèles de langage ne sont rien de plus que des « perroquets stochastiques ». Ils ne comprennent pas le monde réel et ne comptent que la probabilité d'un certain mot, puis génèrent des résultats aléatoires. -des mots ressemblant à un perroquet.

En raison du caractère ininterprétable des réseaux neuronaux, la communauté universitaire ne sait pas si le modèle linguistique est un perroquet aléatoire, et les opinions des différentes parties varient considérablement.

En l’absence de tests largement reconnus, la question de savoir si un modèle peut « comprendre le monde » est devenue une question philosophique plutôt que scientifique.

Cependant, les chercheurs du MIT ont découvert que LLM apprenait des représentations linéaires de l'espace et du temps à plusieurs échelles, et que ces représentations étaient robustes à différents changements de signaux et uniformes dans différents types d'environnement (tels que les villes et les points d'intérêt).

Ils ont même découvert que LLM possède également des « neurones spatiaux » et des « neurones temporels » indépendants qui peuvent coder de manière fiable les coordonnées spatiales et temporelles.

En d’autres termes, le LLM ne consiste pas seulement à apprendre des données statistiques superficielles, mais à acquérir des connaissances structurées sur des dimensions fondamentales telles que l’espace et le temps.

En bref, les grands modèles linguistiques peuvent comprendre le monde.

LLM comprend l'espace et le temps

Dans cet article, les chercheurs se demandaient si le LLM pouvait former un modèle du monde (et donc du temps) à partir du contenu d'un ensemble de données.

Les chercheurs ont tenté de répondre à cette question en extrayant des cartes du monde réel du LLM.

Plus précisément, les chercheurs ont construit six ensembles de données contenant des noms de lieux ou d'événements et les coordonnées spatiales ou temporelles correspondantes dans plusieurs dimensions spatio-temporelles :

Cela inclut les adresses dans le monde entier, les adresses aux États-Unis et les adresses à New York.

De plus, l'ensemble de données comprend également différentes coordonnées temporelles :

1) L'année de décès d'un personnage historique

2) Histoire des 3 000 dernières années

3) Dates de sortie des œuvres d'art et des programmes de divertissement depuis les années 1950

4) Date de publication des gros titres de l'actualité de 2010 à 2020

À l’aide de la famille de modèles Llama 2, les chercheurs ont formé des sondes de régression linéaire qui ont étudié les activations internes des noms de ces lieux et événements à chaque couche du modèle pour prédire leur emplacement ou leur heure dans le monde réel.

Ces expériences exploratoires révèlent que les modèles construisent des représentations spatiales et temporelles dans les premières couches avant d'atteindre un état de plateau (plateauing) près du point médian du modèle, un processus qui aboutit à des modèles plus grands surpassant systématiquement les modèles plus petits.

De plus, les chercheurs ont démontré que ces représentations sont

(1) Linéaire, car les sondes non linéaires ne fonctionnent pas bien

(2) Il peut être très robuste aux changements dans les invites

(3) Différents types de concepts sont similaires (par exemple, les villes et les monuments naturels sont similaires)

Les chercheurs pensent qu'une explication possible de ce résultat est que le modèle a uniquement appris la cartographie du local au national, alors que la sonde a en fait appris la structure géographique globale de la façon dont ces différents groupes sont liés dans le géoespace (ou le temps).

Pour étudier cela, les chercheurs ont effectué une série de contrôles de robustesse pour comprendre comment les sondes se sont généralisées sur différentes distributions de données et comment les sondes formées sur le composant PCA ont fonctionné.

Les résultats des chercheurs montrent que la sonde se souvient de la « position absolue » de ces concepts, mais le modèle possède certaines représentations qui reflètent un « positionnement relatif ».

En d’autres termes, la sonde apprend une cartographie des coordonnées du modèle vers des coordonnées interprétables par l’homme.

Enfin, les chercheurs ont utilisé des sondes pour rechercher des neurones individuels activés en fonction de l’espace ou du temps, fournissant ainsi des preuves solides que le modèle utilise effectivement ces caractéristiques.

Préparation

Pour enquêter, les chercheurs ont construit six ensembles de données de noms d’entités (personnes, lieux, événements, etc.) ainsi que leurs emplacements ou moments d’occurrence respectifs, chacun variant en taille.

Pour chaque ensemble de données, les chercheurs ont inclus plusieurs types d'entités, tels que des lieux densément peuplés comme les villes et des monuments naturels comme les lacs, pour étudier la représentation unifiée de différents types d'objets.

De plus, les chercheurs ont optimisé et enrichi les métadonnées pertinentes pour pouvoir analyser les données grâce à une segmentation plus détaillée et identifier la source des fuites de formation et de test.

informations de localisation

Les chercheurs ont construit trois ensembles de données sur les noms de lieux pour le monde, les États-Unis et la ville de New York. L'ensemble de données mondiales des chercheurs a été construit à partir de données brutes interrogées par DBpedia Lehmann et al.

En outre, les chercheurs ont inclus des emplacements densément peuplés, des emplacements naturels et des emplacements structurels (tels que des bâtiments ou des infrastructures). Les chercheurs ont ensuite comparé ce contenu avec des articles de Wikipédia et filtré les entités ayant au moins 5 000 pages vues sur une période de trois ans.

L'ensemble de données américaines des chercheurs comprend des noms de villes, de comtés, de codes postaux, d'universités, de lieux et de structures naturels, les emplacements peu peuplés ou consultés étant filtrés de la même manière.

L'ensemble de données de la ville de New York contient des emplacements dans la ville tels que des écoles, des églises, des moyens de transport et des logements sociaux.

informations horaires

Les trois ensembles de données temporelles des chercheurs comprennent :

(1) Noms et professions des personnages historiques décédés entre 1000 avant JC et 2000 après JC,

(2) Les titres et les auteurs de chansons, de films et de livres de 1950 à 2020 ont été construits à partir de DBpedia à l'aide de la technologie de filtrage des pages vues de Wikipédia ;

(3) Titres d’actualité de 2010 à 2020 (New York Times), issus de chroniques d’actualité traitant de l’actualité.

Préparation des données

Toutes les expériences des chercheurs ont été réalisées en utilisant la version de base du modèle de la série Llama 2, couvrant 7 à 70 milliards de paramètres.

Pour chaque ensemble de données, les chercheurs exécutent chaque nom d'entité dans le modèle, en le préfixant éventuellement d'un bref indice et en enregistrant l'activation de l'état caché (flux résiduel) à la fin de chaque couche sur le jeton d'entité.

Pour un ensemble de n entités, cela génère un

Activez l'ensemble de données.

sonde

Pour rechercher des preuves de représentations spatiales et temporelles dans LLM, les chercheurs ont utilisé des techniques de sonde standard.

Il s'adapte à un modèle simple d'activations de réseau pour prédire une étiquette cible liée aux données d'entrée étiquetées. En particulier, étant donné un ensemble de données d’activation A ∈ Rn×dmodel et une cible Y contenant des coordonnées temporelles ou bidimensionnelles de latitude et de longitude, les chercheurs ont ajusté des sondes de régression de crête linéaire.

On obtient ainsi une sonde linéaire :

Des performances prédictives élevées sur les données hors échantillon suggèrent que le modèle sous-jacent contient des informations temporelles et spatiales linéairement décodables dans ses représentations, bien que cela ne signifie pas que le modèle utilise réellement ces représentations.

Dans toutes les expériences, les chercheurs ont utilisé une validation croisée efficace sur l’ensemble d’entraînement de la sonde pour régler λ.

Modèles linéaires de l'espace et du temps

existence

Les chercheurs ont d’abord examiné cette question empirique : le modèle représente-t-il le temps et l’espace ? Si oui, où se trouve l'intérieur du modèle ? La qualité de la représentation change-t-elle de manière significative avec la taille du modèle ?

Dans la première expérience des chercheurs, les chercheurs ont formé des sondes pour chaque couche de Llama 2-{7B, 13B, 70B} pour chaque ensemble de données spatiales et temporelles.

Les principaux résultats des chercheurs, présentés ci-dessous, montrent des tendances assez cohérentes entre les ensembles de données. En particulier, les caractéristiques spatiales et temporelles peuvent être récupérées par des sondes linéaires.

À mesure que la taille du modèle augmente, ces représentations deviennent plus précises et la qualité des représentations dans la première moitié du modèle augmente régulièrement avant d'atteindre un état stable.

Ces observations sont cohérentes avec les résultats de la littérature sur le rappel factuel, suggérant que les couches précoces et intermédiaires du MLP sont responsables du rappel des informations sur des sujets factuels.

L’ensemble de données le moins performant est celui de la ville de New York. Ceci est normal étant donné que la plupart des entités sont relativement obscures par rapport à d’autres ensembles de données.

Cependant, il s’agit également de l’ensemble de données dans lequel le modèle le plus grand présente les meilleures performances relatives, avec un R presque 2 fois supérieur à celui des modèles plus petits, ce qui suggère que des LLM suffisamment grands peuvent finalement former des modèles spatiaux détaillés de villes individuelles.

représentation linéaire

Dans la littérature sur l'interprétabilité, de plus en plus de preuves soutiennent l'hypothèse de la représentation linéaire, selon laquelle les caractéristiques des réseaux neuronaux sont représentées de manière linéaire.

Autrement dit, la présence ou la force d'une fonctionnalité peut être lue en projetant l'activation associée sur un certain vecteur de fonctionnalité. Cependant, ces résultats concernent presque toujours des caractéristiques binaires ou catégorielles, contrairement aux caractéristiques naturelles continues de l’espace ou du temps.

Pour tester si les caractéristiques spatiales et temporelles sont représentées de manière linéaire, les chercheurs ont comparé les performances des sondes de régression de crête linéaire avec celles des MLP non linéaires plus expressives.

Les résultats ci-dessous montrent que pour tout ensemble de données ou modèle, l'amélioration de R à l'aide de sondes non linéaires est minime.

Les chercheurs ont considéré cela comme une preuve solide que l’espace et le temps peuvent également être représentés de manière linéaire (ou du moins décodables de manière linéaire) bien qu’ils soient continus.

Sensibilité aux mots indicateurs

Une autre question évidente est de savoir si ces caractéristiques spatiales ou temporelles sont sensibles aux mots indicateurs, c'est-à-dire si le contexte peut induire ou inhiber le rappel de ces faits ?

Intuitivement, pour tout jeton d’entité, le modèle autorégressif est motivé pour générer des représentations adaptées à la résolution de tout contexte ou problème futur possible.

Pour étudier cette question, les chercheurs ont créé un nouvel ensemble de données d'activation, dans lequel ils ont ajouté différents indices à chaque balise d'entité selon plusieurs thèmes de base. Dans tous les cas, les chercheurs ont inclus un indice « vide », ne contenant rien d’autre que le jeton d’entité (et le début du jeton de séquence).

Les chercheurs ont ensuite ajouté une invite demandant au modèle de rappeler des faits pertinents, tels que « Quelle est la latitude et la longitude de <location> ou « Quelle était la date de sortie de <book> ?

Pour les ensembles de données des États-Unis et de la ville de New York, les chercheurs ont également inclus des versions de ces invites demandant où se trouvait l'emplacement aux États-Unis ou à New York afin de lever l'ambiguïté des noms de lieux courants (par exemple, l'hôtel de ville).

Comme référence, les chercheurs ont inclus des indices de 10 jetons aléatoires (échantillonnés pour chaque entité). Pour déterminer si les chercheurs pouvaient brouiller les sujets, pour certains ensembles de données, les chercheurs ont entièrement capitalisé les noms de toutes les entités.

Enfin, pour l’ensemble de données du titre, les chercheurs ont tenté de détecter le dernier jeton et le jeton de point ajouté au titre.

L'image du haut est le résultat du modèle 70B et l'image du bas est le résultat de tous les modèles.

Les chercheurs ont constaté que le fait de demander explicitement des informations au modèle ou de donner des indices de levée d'ambiguïté, comme l'endroit où se trouve un lieu aux États-Unis ou à New York, avait peu d'impact sur les performances. Cependant, les chercheurs ont été surpris de constater à quel point les interférences aléatoires avec les jetons ont dégradé les performances.

La majuscule des noms d'entité réduit également les performances, bien que de manière moins grave et moins inattendue, car cela peut interférer avec la « dé-tokenisation » de l'entité.

Une modification qui a considérablement amélioré les performances consistait à détecter le jeton de point après le titre, indiquant que le point contient des informations récapitulatives sur la phrase à la fin.

Tests de robustesse

La section précédente a montré que des points temps réels ou spatiaux pour différents types d’événements ou de lieux peuvent être récupérés linéairement à partir des activations internes des couches ultérieures du LLM.

Cependant, cela n'implique pas si (ou comment) le modèle utilise réellement les directions de caractéristiques apprises par la sonde, puisque la sonde elle-même peut apprendre une combinaison linéaire de caractéristiques plus simples que le modèle utilise réellement.

Valider en généralisant

Pour illustrer les problèmes potentiels liés aux résultats des chercheurs, considérons la tâche consistant à représenter une carte du monde complète.

Si le modèle présente des caractéristiques binaires presque orthogonales "dans le pays, dont le coefficient est égal à la latitude (longitude) de ce pays.

En supposant qu'un lieu est situé dans un seul pays, une telle détection place chaque entité au centroïde de son pays.

Cependant, dans ce cas, le modèle ne représente pas réellement l’espace, mais seulement l’appartenance à un pays, et il s’agit simplement d’une sonde permettant d’apprendre différentes géométries de pays à partir d’une supervision explicite.

Pour mieux distinguer ces situations, les chercheurs ont analysé la manière dont les sondes se généralisaient lorsqu’elles étaient présentées avec des blocs de données spécifiques.

En particulier, les chercheurs ont formé une série de sondes, et pour chaque sonde, les chercheurs ont fourni respectivement un pays, un état, un arrondissement, un siècle, une décennie pour le monde, les États-Unis, la ville de New York, des personnages historiques, des divertissements et un titre. ensembles de données d’actualité ou année.

Les chercheurs ont ensuite évalué les détections des morceaux de données conservés. Dans le tableau ci-dessus, les chercheurs rapportent l'erreur moyenne du voisin pour un bloc de données lorsqu'il est entièrement réservé, par rapport à l'erreur pour les points de test de ce bloc dans la répartition train-test par défaut (moyenne sur tous les blocs retenus).

Les chercheurs ont constaté que même si les performances de généralisation en souffraient, en particulier pour les ensembles de données spatiales, elles étaient nettement meilleures que pour les ensembles de données aléatoires. En traçant les prévisions pour les États ou pays indiqués dans le graphique ci-dessous, une image plus claire se dégage.

mondial

Autrement dit, la sonde généralise correctement en plaçant les points dans la position relative correcte (mesurée par l'angle entre les centroïdes réels et prédits) plutôt que dans des positions absolues.

Les chercheurs ont considéré cela comme une preuve faible que la sonde extrayait des caractéristiques apprises explicitement par le modèle, mais se souvenaient de la transformation des coordonnées du modèle en coordonnées humaines.

Toutefois, cela n’exclut pas entièrement l’hypothèse de caractéristiques binaires sous-jacentes, car il peut exister des hiérarchies de ces caractéristiques qui ne suivent pas les frontières des pays ou des décennies.

Généraliser à travers les entités

Jusqu'à présent, les discussions des chercheurs affirment implicitement que le modèle représente les coordonnées spatiales ou temporelles de différents types d'entités, telles que des villes ou des monuments naturels, de manière unifiée.

Cependant, tout comme la détection de latitude peut être une somme pondérée de caractéristiques d'appartenance, la détection de latitude peut également être la somme de différentes directions (orthogonales) de latitude de la ville et de latitude de points de repère naturels.

Comme ci-dessus, les chercheurs différencient ces hypothèses en entraînant une série de sondes, où une séparation train-test est effectuée pour conserver tous les points d'une classe d'entité spécifique. Comme le montre le tableau ci-dessous, la proximité est comparée au test par défaut. fractionnement lors de la conservation L'erreur de l'entité, telle que moyenne précédemment sur toutes ces répartitions.

Les résultats montrent que les sondes généralisent dans une large mesure les types d’entités, à l’exception de l’ensemble de données de divertissement.

neurones spatio-temporels

Bien que ces résultats précédents soient suggestifs, rien ne prouve que le modèle utilise les fonctionnalités apprises par la sonde.

Pour résoudre ce problème, les chercheurs ont recherché des neurones individuels avec des poids d'entrée ou de sortie présentant une similarité cosinusoïdale élevée avec la direction de détection apprise.

Autrement dit, les chercheurs ont recherché des neurones qui lisaient ou écrivaient dans des directions similaires à celles apprises par la sonde.

Ils ont découvert que lorsque l’ensemble des données d’activation était projeté sur les poids des neurones les plus similaires, ces neurones étaient en effet très sensibles à la véritable localisation de l’entité dans l’espace ou dans le temps.

Autrement dit, le modèle contient des neurones individuels qui sont eux-mêmes des sondes dotées d'un pouvoir prédictif considérable.

De plus, ces neurones sont sensibles à tous les types d’entités de l’ensemble de données, ce qui suggère en outre que ces représentations sont unifiées.

Si les sondes entraînées sous supervision explicite constituent une limite supérieure approximative de la capacité d'un modèle à représenter ces caractéristiques spatiales et temporelles, alors les performances des neurones individuels constituent une limite inférieure.

En particulier, les chercheurs pensent souvent que les caractéristiques sont distribuées de manière additive, ce qui rend le niveau d’analyse des neurones individuels erroné.

Pourtant, l’existence de ces neurones uniques (qui ne reçoivent aucune supervision autre que la prédiction du prochain jeton) est une preuve solide que le modèle apprend et utilise des caractéristiques spatiales et temporelles.

Othello GPT prouve que LLM comprend le monde et est salué par Andrew Ng

L'inspiration la plus directe pour les chercheurs du MIT provient de recherches antérieures sur la mesure dans laquelle les systèmes d'apprentissage profond peuvent former des modèles interprétables du processus de génération de données.

Les démonstrations les plus puissantes et les plus claires proviennent sans aucun doute des modèles GPT formés aux échecs et aux jeux d'Othello : ces modèles ont des représentations claires du plateau et de l'état du jeu.

En février de cette année, des chercheurs de l'Université Harvard et du MIT ont publié conjointement une nouvelle étude, Othello-GPT, qui a vérifié l'efficacité de la représentation interne dans un simple jeu de société.

Ils pensent que le modèle linguistique établit effectivement un modèle mondial en interne et n'est pas simplement une simple mémoire ou des statistiques, mais que la source de sa capacité n'est pas claire.

Lien papier : https://arxiv.org/pdf/2210.13382.pdf

Le processus expérimental est très simple. Sans aucune connaissance préalable des règles d'Othello, les chercheurs ont découvert que le modèle pouvait prédire les opérations de mouvement légal et capturer l'état de l'échiquier avec une très grande précision.

Ng a exprimé sa grande reconnaissance pour cette recherche dans la rubrique « Lettre ». Il estime que, sur la base de cette recherche, il y a des raisons de croire que les modèles linguistiques à grande échelle ont construit un modèle mondial suffisamment complexe et, dans une certaine mesure, comprennent le monde. monde.

Lien du blog : https://www.deeplearning.ai/the-batch/does-ai-understand-the-world/

modèle mondial d'échiquier

Si vous imaginez l'échiquier comme un simple « monde » et exigez que le modèle prenne des décisions continues pendant le jeu, vous pouvez d'abord tester si le modèle séquentiel peut apprendre la représentation du monde.

Les chercheurs ont choisi un simple jeu d'Othello, Othello, comme plate-forme expérimentale. Ses règles sont les suivantes :

Au centre de l'échiquier 8*8, placez d'abord quatre pièces d'échecs, deux pour chacune des pièces noires et deux blanches ; puis les deux camps jouent à tour de rôle dans le sens droit ou diagonal, toutes les pièces ennemies (sans compter les espaces) entre les deux. les pièces deviennent Ji Zi (appelé capture), chaque mouvement doit avoir une capture ; à la fin, le plateau est complètement occupé, et le joueur avec le plus de captures gagne.

Par rapport aux échecs, les règles d'Othello sont beaucoup plus simples ; en même temps, l'espace de recherche des jeux d'échecs est suffisamment grand pour que le modèle ne puisse pas terminer la génération de séquences via la mémoire, il est donc très approprié pour tester la capacité d'apprentissage de la représentation du monde du modèle.

Modèle de langage Othello

Les chercheurs ont d’abord formé un modèle de langage variant GPT (Othello-GPT) et ont saisi le script du jeu (une série d’opérations de mouvement d’échecs effectuées par le joueur) dans le modèle, mais le modèle n’avait aucune connaissance préalable du jeu et des règles associées.

Le modèle n'est pas non plus explicitement formé pour poursuivre l'amélioration stratégique, gagner des parties, etc., mais il est seulement plus précis lors de la génération d'opérations de mouvement légales d'Othello.

Ensemble de données

Les chercheurs ont utilisé deux ensembles de données de formation :

Championship accorde plus d'attention à la qualité des données, principalement à partir des mouvements de réflexion plus stratégiques adoptés par les joueurs humains professionnels dans les deux tournois d'Othello, mais n'a collecté respectivement que 7605 et 132921 échantillons de jeu, deux ensembles de données. Ensuite, ils ont été divisés au hasard en un ensemble d'entraînement ( 20 millions d'échantillons) et un ensemble de validation (3,796 millions) dans un rapport de 8:2.

Synthetic accorde plus d'attention à l'échelle des données et consiste en des opérations de mouvement aléatoires et légales. La distribution des données est différente de l'ensemble de données du championnat, mais est uniformément échantillonnée à partir de l'arbre de jeu Othello, dont 20 millions d'échantillons sont utilisés pour l'entraînement. Des millions d’échantillons ont été utilisés pour la vérification.

La description de chaque jeu consiste en une chaîne de jetons et la taille du vocabulaire est de 60 (8*8-4).

Modèles et formation

L'architecture du modèle est un modèle GPT à 8 couches avec 8 têtes et une dimension cachée de 512.

Les poids du modèle sont initialisés de manière complètement aléatoire, y compris la couche d'incorporation de mots. Bien qu'il existe une relation géométrique dans la liste de mots représentant la position de l'échiquier (par exemple, C4 étant inférieur à B4), ce biais inductif n'est pas explicitement exprimé et est laissé. au modèle pour apprendre.

Prédire les mouvements légaux

La principale mesure d'évaluation du modèle est de savoir si les actions de mouvement prédites par le modèle sont conformes aux règles d'Othello.

Le taux d'erreur d'Othello-GPT formé sur l'ensemble de données synthétiques est de 0,01 % et le taux d'erreur sur l'ensemble de données de championnat est de 5,17 %. En comparaison, le taux d'erreur d'Othello-GPT non entraîné est de 93,29 %, c'est-à-dire que les deux ensembles de données permettent le modèle pour apprendre dans une certaine mesure les règles du jeu.

Une explication possible est que le modèle a mémorisé tous les mouvements du jeu Othello.

Pour tester cette conjecture, les chercheurs ont synthétisé un nouvel ensemble de données : au début de chaque partie, Othello avait quatre positions d'ouverture possibles (C5, D6, E3 et F4), et a déplacé tous les coups d'ouverture de C5. Après la division, il a été utilisé comme ensemble d'entraînement, puis les données d'ouverture C5 ont été utilisées comme test, c'est-à-dire que près d'un quart de l'arbre du jeu a été supprimé. Il a été constaté que le taux d'erreur du modèle n'était toujours que de 0,02 %.

Ainsi, les hautes performances d'Othello-GPT ne sont pas dues à la mémoire, car les données de test sont totalement invisibles pendant le processus de formation. Alors, qu'est-ce qui fait exactement que le modèle prédit avec succès ?

Explorer les représentations internes

Un outil couramment utilisé pour détecter la représentation interne des réseaux neuronaux est une sonde. Chaque sonde est un classificateur ou un régresseur dont l'entrée est constituée des activations internes du réseau et est entraînée pour prédire les caractéristiques d'intérêt.

Dans cette tâche, afin de détecter si l'activation interne d'Othello-GPT contient la représentation de l'état actuel de l'échiquier, après avoir saisi la séquence de mouvements, le vecteur d'activation interne est utilisé pour prédire la prochaine étape du mouvement.

Lors de l'utilisation de sondes linéaires, la représentation interne entraînée d'Othello-GPT n'est que légèrement plus précise qu'une estimation aléatoire.

Lors de l'utilisation de sondes non linéaires (MLP à deux couches), le taux d'erreur diminue considérablement, prouvant que l'état de la carte n'est pas stocké de manière simple dans les activations du réseau.

expérience d'intervention

Pour déterminer la relation causale entre les prédictions du modèle et les représentations émergentes du monde, c'est-à-dire si l'état de l'échiquier a réellement affecté les prédictions du réseau, les chercheurs ont mené une série d'expériences d'intervention et mesuré l'ampleur des effets qui en résultent.

Étant donné un ensemble d'activations d'Othello-GPT, utilisez des sondes pour prédire l'état de la carte, enregistrez les prédictions de mouvements associées, puis modifiez les activations pour permettre aux sondes de prédire l'état de la carte mis à jour.

Les opérations d'intervention incluent le changement de la pièce d'échecs dans une certaine position du blanc au noir, etc. Une petite modification amènera les résultats du modèle à constater que la représentation interne peut compléter la prédiction de manière fiable, c'est-à-dire qu'il existe une influence causale entre la représentation interne et la prédiction du modèle.

Visualisation

En plus des expériences d'intervention pour vérifier l'efficacité des représentations internes, les chercheurs visualisent également les résultats de prédiction. Par exemple, pour chaque pièce d'échecs sur l'échiquier, vous pouvez demander au modèle comment les résultats de prédiction du modèle changeront si la pièce d'échecs est. modifié à l'aide de la technologie d'intervention, correspondant à l'importance des résultats prédits.

Comme on peut le constater, des tendances claires émergent dans les cartes de saillance latente des prédictions top1 pour les Othello-GPT formés sur des ensembles de données synthétiques et de tournoi.

En bref, il ressort de cette étude de Harvard et du MIT que les grands modèles linguistiques comprennent effectivement le monde, et il n'est pas étonnant qu'ils soient loués par Andrew Ng.

GPT-4 n’est-il que l’étincelle de l’AGI ? LLM finira par prendre sa retraite, le modèle mondial est l'avenir

Pourquoi les « modèles mondiaux » sont-ils si attrayants ?

C'est précisément parce que la forme ultime de l'intelligence artificielle et le but ultime du développement – ​​l'intelligence artificielle générale (IAG) – est un « modèle capable de comprendre le monde », et pas seulement un « modèle qui décrit le monde ».

En 1931, Kurt Gödel publia le théorème d'incomplétude.

Le théorème de Gödel montre que même les mathématiques ne peuvent pas tout prouver de manière concluante (les humains disposeront toujours de faits non démontrables), tandis que la théorie quantique montre que le manque de certitude dans le monde des chercheurs les empêche de prédire certains événements, tels que le comportement des électrons.

Bien qu'Einstein ait exprimé un jour l'opinion célèbre selon laquelle « Dieu ne joue pas aux dés avec l'univers », les limites humaines sont déjà pleinement reflétées lorsqu'il s'agit de prédire ou de comprendre les choses en physique.

Dans son livre « Comment nous apprenons », le chercheur Stanislas Dehaene définit l'apprentissage comme « le processus de formation d'un modèle du monde ».

En 2016, AlphaGo a battu le champion du monde Lee Sedol sur le score de 4 à 1 au jeu de Go.

Cependant, il lui manque la capacité humaine de reconnaître des tactiques inhabituelles et de s’adapter en conséquence. Il ne s’agit donc que d’une intelligence artificielle faible.

L’AGI dont les chercheurs ont besoin est un modèle mondial cohérent avec l’expérience et capable de prédire avec précision.

Le 13 avril, Microsoft, partenaire d'OpenAI, a publié un article « Sparks of Artificial General Intelligence : Early experimentals with GPT-4 ».

Adresse papier : https://arxiv.org/pdf/2303.12712

Il mentionnait :

GPT-4 maîtrise non seulement le langage, mais peut également résoudre des tâches de pointe couvrant les mathématiques, le codage, la vision, la médecine, le droit, la psychologie et d'autres domaines sans avoir besoin d'invites spéciales. Et dans toutes les tâches mentionnées ci-dessus, les niveaux de performance de GPT-4 sont presque équivalents aux niveaux humains. Sur la base de l’étendue et de la profondeur des capacités de GPT-4, les chercheurs pensent qu’il peut raisonnablement être considéré comme une version proche, mais non complète, de l’intelligence artificielle générale.

Cependant, comme de nombreux experts l’ont critiqué, assimiler à tort performance et capacité signifie que GPT-4 génère une description sommaire du monde qui est considérée comme une compréhension du monde réel.

La plupart des modèles actuels sont uniquement formés sur du texte et n'ont pas la capacité de parler, d'entendre, de sentir et d'agir dans le monde réel.

Tout comme dans l'allégorie de la grotte de Platon, les personnes vivant dans la grotte ne peuvent voir que des ombres sur le mur, mais ne peuvent pas reconnaître l'existence réelle des choses.

Les recherches menées par Harvard et le MIT en février ainsi que l'article d'aujourd'hui soulignent que les grands modèles linguistiques peuvent en effet comprendre le monde dans une certaine mesure, et pas seulement garantir qu'ils sont grammaticalement corrects.

Les possibilités à elles seules sont suffisamment excitantes.

Références :

https://arxiv.org/abs/2310.02207

https://twitter.com/wesg52/status/1709551516577902782