Quelle des Nachdrucks des Artikels: AI DreamWorks

Quelle des Artikels: Xinzhiyuan

Zwei Wissenschaftler des MIT haben eine Arbeit veröffentlicht, die beweist, dass große Sprachmodelle die Welt verstehen können! Ihre Arbeit zeigt, dass LLM nicht nur oberflächliche Statistiken lernt, sondern auch ein Modell der Welt, das grundlegende Dimensionen wie Raum und Zeit umfasst.

Gibt es innerhalb des großen Sprachmodells ein Weltmodell?

Hat LLM ein Gefühl für Raum? Und auf mehreren raumzeitlichen Skalen?

Kürzlich haben mehrere Forscher am MIT herausgefunden, dass die Antwort „Ja“ lautet!

Papieradresse: https://arxiv.org/abs/2310.02207

Sie fanden heraus, dass Llama-2-70B tatsächlich in der Lage war, eine wörtliche Karte der realen Welt der Forscher darzustellen.

Zur räumlichen Darstellung ließen die Forscher das Llama-2-Modell auf die Namen Zehntausender Städte, Regionen und Naturdenkmäler auf der ganzen Welt anwenden.

Sie trainierten einen linearen Detektor auf die letzte Token-Aktivierung und fanden heraus, dass Llama-2 den wahren Breiten- und Längengrad jedes Ortes vorhersagen kann.

Zur zeitlichen Darstellung führten die Forscher Modelle durch und trainierten lineare Sonden zu den Namen von Prominenten der letzten 3.000 Jahre, den Namen von Liedern, Filmen und Büchern seit 1950 sowie den Schlagzeilen der New York Times in den 2010er Jahren Tod von Prominenten, die Veröffentlichungsdaten von Liedern, Filmen und Büchern sowie die Veröffentlichungsdaten von Nachrichten.

Kurz gesagt, alle Schlussfolgerungen zeigen, dass LLM nicht nur ein zufälliger Papagei ist – Llama-2 enthält ein detailliertes Modell der Welt. Es ist keine Übertreibung zu sagen, dass Menschen im großen Sprachmodell sogar ein „Längengradneuron“ entdeckt haben!

Gleich nach der Veröffentlichung dieser Arbeit stieß sie auf begeisterte Resonanz. Der Autor hat die Zusammenfassung des Artikels auf Twitter retweetet und in weniger als 15 Stunden wurde er mehr als 1,4 Millionen Mal gelesen!

Internetnutzer riefen aus: Diese Arbeit ist erstaunlich!

Jemand sagte: Intuitiv ist das vernünftig. Denn das Gehirn destilliert unsere physische Welt und speichert sie in biologischen Netzwerken. Wenn wir Dinge „sehen“, handelt es sich tatsächlich um Projektionen, die unser Gehirn intern verarbeitet.

Es ist unglaublich, dass ihr das modellieren konntet!

Einige vertreten die gleiche Ansicht und meinen, dass wir vielleicht den Schöpfer täuschen, indem wir versuchen, das Gehirn nachzuahmen.

LLM ist kein zufälliger Papagei

Zuvor haben viele Leute spekuliert, dass die erstaunliche Fähigkeit des großen Sprachmodells möglicherweise nur darauf zurückzuführen ist, dass es eine große Anzahl oberflächlicher statistischer Datensätze lernt, und nicht darauf, dass es sich um ein kohärentes Modell handelt, das den Datengenerierungsprozess (dh eine Welt) umfasst Modell) .

Im Jahr 2021 veröffentlichte die Linguistin Emily M. Bender einen Artikel, in dem sie argumentierte, dass große Sprachmodelle nichts anderes als „stochastische Papageien“ seien. Sie verstehen die reale Welt nicht und zählen nur die Wahrscheinlichkeit, dass ein bestimmtes Wort zufällig generiert wird -sehende Worte wie ein Papagei.

Aufgrund der Uninterpretierbarkeit neuronaler Netze ist sich die akademische Gemeinschaft nicht sicher, ob das Sprachmodell ein zufälliger Papagei ist, und die Meinungen verschiedener Parteien gehen stark auseinander.

Da weithin anerkannte Tests fehlen, ist die Frage, ob ein Modell „die Welt verstehen“ kann, eher eine philosophische als eine wissenschaftliche Frage.

Allerdings fanden MIT-Forscher heraus, dass LLM lineare Darstellungen von Raum und Zeit in mehreren Maßstäben lernte und dass diese Darstellungen robust gegenüber unterschiedlichen Hinweisänderungen und einheitlich über verschiedene Umgebungstypen hinweg (z. B. Städte und Sehenswürdigkeiten) waren.

Sie fanden sogar heraus, dass LLM auch über unabhängige „Raumneuronen“ und „Zeitneuronen“ verfügt, die Raum- und Zeitkoordinaten zuverlässig kodieren können.

Mit anderen Worten geht es beim LLM nicht nur um das Erlernen oberflächlicher statistischer Daten, sondern darum, strukturiertes Wissen über grundlegende Dimensionen wie Raum und Zeit zu erwerben.

Kurz gesagt, große Sprachmodelle können die Welt verstehen.

LLM versteht Raum und Zeit

In diesem Artikel stellten die Forscher die Frage, ob LLM aus den Inhalten eines Datensatzes ein Modell der Welt (und damit der Zeit) bilden kann.

Forscher versuchten, diese Frage zu beantworten, indem sie reale Karten aus LLM extrahierten.

Konkret erstellten die Forscher sechs Datensätze mit Orts- oder Ereignisnamen und entsprechenden räumlichen oder zeitlichen Koordinaten über mehrere raumzeitliche Dimensionen hinweg:

Dazu gehören Adressen weltweit, Adressen innerhalb der Vereinigten Staaten und Adressen innerhalb von New York City.

Darüber hinaus umfasst der Datensatz auch verschiedene Zeitkoordinaten:

1) Das Todesjahr einer historischen Persönlichkeit

2) Geschichte der letzten 3.000 Jahre

3) Veröffentlichungsdaten von Kunstwerken und Unterhaltungsprogrammen seit den 1950er Jahren

4) Erscheinungsdatum der Schlagzeilen von 2010 bis 2020

Mithilfe der Modellfamilie Llama 2 trainierten die Forscher lineare Regressionssonden, die die internen Aktivierungen der Namen dieser Orte und Ereignisse auf jeder Ebene des Modells untersuchten, um deren realen Standort oder Zeitpunkt vorherzusagen.

Diese explorativen Experimente zeigen, dass Modelle in den frühen Schichten räumliche und zeitliche Darstellungen aufbauen, bevor sie in der Nähe des Modellmittelpunkts einen Plateauzustand (Plateauing) erreichen, ein Prozess, der dazu führt, dass größere Modelle kleinere Modelle durchweg übertreffen.

Darüber hinaus zeigten die Forscher, dass dies der Fall ist

(1) Linear, da nichtlineare Sonden keine gute Leistung erbringen

(2) Es kann sehr robust gegenüber Änderungen in Eingabeaufforderungen sein

(3) Verschiedene Arten von Konzepten sind ähnlich (z. B. sind Städte und Naturdenkmäler ähnlich).

Die Forscher glauben, dass eine mögliche Erklärung für dieses Ergebnis darin besteht, dass das Modell nur die Kartierung von lokal auf national gelernt hat, während die Sonde tatsächlich die globale geografische Struktur gelernt hat, wie diese verschiedenen Gruppen im Georaum (oder in der Zeit) miteinander in Beziehung stehen.

Um dies zu untersuchen, führten die Forscher eine Reihe von Robustheitsprüfungen durch, um zu verstehen, wie die Sonden auf unterschiedliche Datenverteilungen generalisierten und wie die auf der PCA-Komponente trainierten Sonden funktionierten.

Die Ergebnisse der Forscher zeigen, dass sich die Sonde die „absolute Position“ dieser Konzepte merkt, das Modell jedoch über einige Darstellungen verfügt, die die „relative Positionierung“ widerspiegeln.

Mit anderen Worten: Die Sonde lernt eine Zuordnung von Koordinaten im Modell zu vom Menschen interpretierbaren Koordinaten.

Schließlich verwendeten die Forscher Sonden, um nach einzelnen Neuronen zu suchen, die als Funktion von Raum oder Zeit aktiviert wurden, und lieferten damit starke Beweise dafür, dass das Modell diese Funktionen tatsächlich nutzt.

Vorbereitung

Um dies zu untersuchen, erstellten die Forscher sechs Datensätze mit Namen von Entitäten (Personen, Orte, Ereignisse usw.) zusammen mit ihren jeweiligen Orten oder Zeitpunkten ihres Auftretens, die jeweils unterschiedlich groß waren.

Für jeden Datensatz bezogen die Forscher mehrere Arten von Entitäten ein, beispielsweise dicht besiedelte Orte wie Städte und Naturdenkmäler wie Seen, um eine einheitliche Darstellung verschiedener Objekttypen zu untersuchen.

Darüber hinaus haben die Forscher relevante Metadaten optimiert und angereichert, um die Daten durch detailliertere Segmentierung analysieren und die Quelle von Trainings- und Testlecks identifizieren zu können.

Standortinformationen

Die Forscher erstellten drei Ortsnamen-Datensätze für die Welt, die Vereinigten Staaten und New York City. Der Weltdatensatz der Forscher wurde aus Rohdaten erstellt, die von DBpedia Lehmann et al. abgefragt wurden.

Darüber hinaus berücksichtigten die Forscher dicht besiedelte Standorte, natürliche Standorte und bauliche Standorte (z. B. Gebäude oder Infrastruktur). Anschließend haben die Forscher diese Inhalte mit Wikipedia-Artikeln abgeglichen und Entitäten mit mindestens 5.000 Seitenaufrufen über einen Zeitraum von drei Jahren herausgefiltert.

Der US-Datensatz der Forscher umfasst Namen von Städten, Landkreisen, Postleitzahlen, Universitäten, natürlichen Orten und Strukturen, wobei dünn besiedelte oder besuchte Orte ebenfalls herausgefiltert werden.

Der New York City-Datensatz enthält Standorte innerhalb der Stadt wie Schulen, Kirchen, Transporteinrichtungen und Sozialwohnungen.

Zeitinformationen

Zu den drei zeitlichen Datensätzen der Forscher gehören:

(1) Namen und Berufe historischer Persönlichkeiten, die zwischen 1000 v. Chr. und 2000 n. Chr. starben,

(2) Titel und Autoren von Liedern, Filmen und Büchern von 1950 bis 2020 wurden aus DBpedia mithilfe der Wikipedia-Seitenaufruffiltertechnologie erstellt;

(3) Schlagzeilen der New York Times von 2010 bis 2020, aus Nachrichtenabschnitten, die über aktuelle Ereignisse berichten.

Datenaufbereitung

Alle Experimente der Forscher wurden mit der Basisversion des Llama-2-Serienmodells durchgeführt, das 7 bis 70 Milliarden Parameter abdeckt.

Für jeden Datensatz führen die Forscher jeden Entitätsnamen durch das Modell, stellen ihm möglicherweise einen kurzen Hinweis voran und speichern die Aktivierung des verborgenen Zustands (Reststrom) am Ende jeder Ebene auf dem Entitätstoken.

Für eine Menge von n Entitäten wird dadurch a generiert

Aktivieren Sie den Datensatz.

Sonde

Um nach Beweisen für räumliche und zeitliche Darstellungen im LLM zu suchen, verwendeten die Forscher Standardsondentechniken.

Es passt ein einfaches Modell für Netzwerkaktivierungen an, um eine Zielbezeichnung vorherzusagen, die sich auf die gekennzeichneten Eingabedaten bezieht. Insbesondere anhand eines Aktivierungsdatensatzes A ∈ Rn×dmodel und eines Ziels Y, das Zeit- oder zweidimensionale Breiten- und Längenkoordinaten enthält, passten die Forscher lineare Gratregressionssonden an.

Somit erhält man eine lineare Sonde:

Eine hohe Vorhersageleistung bei Out-of-Sample-Daten deutet darauf hin, dass das zugrunde liegende Modell linear dekodierbare zeitliche und räumliche Informationen in seinen Darstellungen enthält. Dies bedeutet jedoch nicht, dass das Modell diese Darstellungen tatsächlich verwendet.

In allen Experimenten nutzten die Forscher eine effiziente Auslassungs-Kreuzvalidierung des Probe-Trainingssatzes, um λ abzustimmen.

Lineare Modelle von Raum und Zeit

Existenz

Die Forscher gingen zunächst dieser empirischen Frage nach: Stellt das Modell Zeit und Raum dar? Wenn ja, wo im Modell? Ändert sich die Darstellungsqualität erheblich mit der Modellgröße?

Im ersten Experiment der Forscher trainierten die Forscher Sonden für jede Schicht von Llama 2-{7B, 13B, 70B} für jeden räumlichen und zeitlichen Datensatz.

Die unten aufgeführten wichtigsten Ergebnisse der Forscher zeigen ziemlich konsistente Muster in allen Datensätzen. Insbesondere können durch lineare Sonden sowohl räumliche als auch zeitliche Merkmale wiederhergestellt werden.

Mit zunehmender Größe des Modells werden diese Darstellungen genauer und die Qualität der Darstellungen in der ersten Hälfte des Modells nimmt stetig zu, bevor ein stabiler Zustand erreicht wird.

Diese Beobachtungen stimmen mit Ergebnissen aus der Literatur zum Faktenrückruf überein, was darauf hindeutet, dass die frühen bis mittleren MLP-Schichten für das Abrufen von Informationen über Sachthemen verantwortlich sind.

Der Datensatz mit der schlechtesten Leistung ist der New York City-Datensatz. Dies ist zu erwarten, da die meisten Entitäten im Vergleich zu anderen Datensätzen relativ unklar sind.

Dies ist jedoch auch der Datensatz, bei dem das größte Modell die beste relative Leistung aufweist, mit einem R, das fast doppelt so hoch ist wie der kleinerer Modelle, was darauf hindeutet, dass ausreichend große LLMs letztendlich detaillierte räumliche Modelle einzelner Städte bilden können.

lineare Darstellung

In der Interpretierbarkeitsliteratur gibt es zunehmend Belege für die Hypothese der linearen Darstellung, dass Merkmale in neuronalen Netzen linear dargestellt werden.

Das heißt, das Vorhandensein oder die Stärke eines Merkmals kann ausgelesen werden, indem die zugehörige Aktivierung auf einen bestimmten Merkmalsvektor projiziert wird. Diese Ergebnisse beziehen sich jedoch fast immer auf binäre oder kategoriale Merkmale, im Gegensatz zu natürlichen kontinuierlichen Merkmalen von Raum oder Zeit.

Um zu testen, ob räumliche und zeitliche Merkmale linear dargestellt werden, verglichen die Forscher die Leistung linearer Ridge-Regressionssonden mit der Leistung ausdrucksstärkerer nichtlinearer MLPs.

Die folgenden Ergebnisse zeigen, dass die Verbesserung von R bei Verwendung nichtlinearer Sonden für jeden Datensatz oder jedes Modell minimal ist.

Die Forscher betrachteten dies als starken Beweis dafür, dass Raum und Zeit trotz ihrer Kontinuität auch linear dargestellt (oder zumindest linear dekodierbar) werden können.

Sensibilität gegenüber Hinweiswörtern

Eine weitere offensichtliche Frage ist, ob diese räumlichen oder zeitlichen Merkmale empfindlich auf Stichworte reagieren, das heißt, kann der Kontext die Erinnerung an diese Fakten induzieren oder hemmen?

Intuitiv ist das autoregressive Modell für jedes Entitäts-Token motiviert, Darstellungen zu generieren, die zur Lösung möglicher zukünftiger Kontexte oder Probleme geeignet sind.

Um diese Frage zu untersuchen, erstellten die Forscher einen neuen Aktivierungsdatensatz, in dem sie zu jedem Entitäts-Tag unterschiedliche Hinweise zu mehreren Grundthemen hinzufügten. In allen Fällen fügten die Forscher einen „leeren“ Hinweis hinzu, der nichts außer dem Entitäts-Token (und dem Anfang des Sequenz-Tokens) enthielt.

Die Forscher fügten dann eine Eingabeaufforderung hinzu, die das Modell aufforderte, sich an relevante Fakten zu erinnern, wie zum Beispiel „Was ist der Breiten- und Längengrad von <location> oder „Was war das Erscheinungsdatum von <book>?“

Für die Datensätze der Vereinigten Staaten und von New York City fügten die Forscher auch Versionen dieser Eingabeaufforderungen ein, in denen gefragt wurde, wo in den Vereinigten Staaten oder in New York City sich der Standort befand, um gebräuchliche Ortsnamen (z. B. Rathaus) eindeutig zu machen.

Als Grundlage verwendeten die Forscher Hinweise auf 10 zufällige Token (für jede Entität ausgewählt). Um festzustellen, ob die Forscher die Subjekte verschleiern konnten, schrieben die Forscher bei einigen Datensätzen die Namen aller Entitäten vollständig groß.

Schließlich versuchten die Forscher für den Titeldatensatz, das letzte Token und das an den Titel angehängte Punkt-Token zu erkennen.

Das obere Bild ist das Ergebnis des 70B-Modells und das untere Bild ist das Ergebnis aller Modelle.

Die Forscher fanden heraus, dass das explizite Auffordern von Informationen durch das Modell oder das Geben von Begriffsklärungshinweisen, etwa wo sich ein Ort in den Vereinigten Staaten oder in New York City befindet, kaum Auswirkungen auf die Leistung hatte. Die Forscher waren jedoch überrascht, wie stark die zufällige Beeinträchtigung der Token-Leistung beeinträchtigt wurde.

Auch die Großschreibung von Entitätsnamen verringert die Leistung, wenn auch weniger schwerwiegend und weniger unerwartet, da dies die „De-Tokenisierung“ der Entität beeinträchtigen kann.

Eine Änderung, die die Leistung deutlich verbesserte, bestand darin, das Punkt-Token nach dem Titel zu erkennen, was darauf hinweist, dass der Punkt einige zusammenfassende Informationen zum Satz am Ende enthält.

Robustheitsprüfung

Der vorherige Abschnitt hat gezeigt, dass Echtzeit- oder Raumpunkte für verschiedene Arten von Ereignissen oder Orten linear aus den internen Aktivierungen späterer Schichten im LLM wiederhergestellt werden können.

Dies bedeutet jedoch nicht, ob (oder wie) das Modell tatsächlich die von der Sonde gelernten Merkmalsrichtungen verwendet, da die Sonde selbst eine lineare Kombination einfacherer Merkmale lernen kann, die das Modell tatsächlich verwendet.

Validieren Sie durch Verallgemeinerung

Um die möglichen Probleme mit den Ergebnissen der Forscher zu veranschaulichen, stellen Sie sich die Aufgabe, eine vollständige Weltkarte darzustellen.

Wenn das Modell nahezu orthogonale binäre Merkmale „im Land“ aufweist, ist deren Koeffizient gleich dem Breitengrad (Längengrad) dieses Landes.

Unter der Annahme, dass sich ein Ort nur in einem Land befindet, platziert eine solche Erkennung jede Entität an ihrem Landesschwerpunkt.

Allerdings repräsentiert das Modell in diesem Fall nicht wirklich den Raum, sondern nur die Länderzugehörigkeit, und es ist lediglich eine Sonde zum Erlernen verschiedener Ländergeometrien aus expliziter Aufsicht.

Um diese Situationen besser unterscheiden zu können, analysierten die Forscher, wie sich die Sonden verallgemeinerten, wenn ihnen bestimmte Datenblöcke präsentiert wurden.

Insbesondere trainierten die Forscher eine Reihe von Sonden und gaben für jede Sonde ein Land, einen Staat, einen Bezirk, ein Jahrhundert bzw. Jahrzehnt für die Welt, die Vereinigten Staaten, New York City, historische Persönlichkeiten, Unterhaltung und eine Schlagzeile an Nachrichtendatensätze oder Jahr.

Anschließend werteten die Forscher die Erkennung der gespeicherten Datenblöcke aus. In der obigen Tabelle geben die Forscher den durchschnittlichen Nachbarfehler für einen vollständig reservierten Datenblock im Vergleich zum Fehler für die Testpunkte dieses Blocks in der standardmäßigen Zugtestaufteilung an (gemittelt über alle zurückgehaltenen Blöcke).

Die Forscher fanden heraus, dass die Generalisierungsleistung zwar darunter litt, insbesondere bei räumlichen Datensätzen, diese jedoch deutlich besser war als bei Zufallsdatensätzen. Durch die Darstellung der Prognosen für die in der folgenden Tabelle gekennzeichneten Bundesstaaten oder Länder ergibt sich ein klareres Bild.

weltweit

Das heißt, die Sonde verallgemeinert korrekt, indem sie Punkte an der richtigen relativen Position (gemessen am Winkel zwischen dem wahren und dem vorhergesagten Schwerpunkt) und nicht an absoluten Positionen platziert.

Die Forscher betrachteten dies als schwachen Beweis dafür, dass die Sonde explizit vom Modell gelernte Merkmale extrahierte, sich aber an die Transformation von Modellkoordinaten in menschliche Koordinaten erinnerte.

Dies schließt jedoch die Hypothese zugrunde liegender binärer Merkmale nicht vollständig aus, da es Hierarchien solcher Merkmale geben kann, die keinen Länder- oder Jahrzehntsgrenzen folgen.

Entitätsübergreifend verallgemeinern

In den bisherigen Diskussionen der Forscher ist die Behauptung implizit enthalten, dass das Modell die räumlichen oder zeitlichen Koordinaten verschiedener Arten von Einheiten, wie beispielsweise Städten oder Naturdenkmälern, auf einheitliche Weise darstellt.

Doch ebenso wie die Breitengraderkennung eine gewichtete Summe von Zugehörigkeitsmerkmalen sein kann, kann die Breitengraderkennung auch die Summe verschiedener (orthogonaler) Richtungen des Breitengrads einer Stadt und eines natürlichen Wahrzeichens sein.

Ähnlich wie oben unterscheiden die Forscher zwischen diesen Hypothesen, indem sie eine Reihe von Sonden trainieren, bei denen eine Zugtestaufteilung durchgeführt wird, um alle Punkte einer bestimmten Entitätsklasse beizubehalten. Wie in der folgenden Tabelle gezeigt, wird die Nähe mit dem Standardtest verglichen Aufteilung bei Beibehaltung Der Fehler der Entität, wie zuvor über alle derartigen Aufteilungen gemittelt.

Die Ergebnisse zeigen, dass die Probes die Entitätstypen mit Ausnahme des Unterhaltungsdatensatzes weitgehend verallgemeinern.

Raum- und Zeitneuronen

Obwohl diese früheren Ergebnisse vielversprechend sind, gibt es keine Hinweise darauf, dass das Modell von der Sonde gelernte Merkmale nutzt.

Um dieses Problem anzugehen, suchten die Forscher nach einzelnen Neuronen mit Eingabe- oder Ausgabegewichten, die eine hohe Kosinus-Ähnlichkeit mit der erlernten Erkennungsrichtung aufwiesen.

Das heißt, die Forscher suchten nach Neuronen, die in Richtungen lesen oder schreiben, die den von der Sonde gelernten Richtungen ähneln.

Sie fanden heraus, dass, wenn der Aktivierungsdatensatz auf die Gewichte der ähnlichsten Neuronen projiziert wurde, diese Neuronen tatsächlich sehr empfindlich auf den wahren Standort der Entität im Raum oder in der Zeit reagierten.

Das heißt, es gibt einzelne Neuronen im Modell, die selbst Merkmalssonden mit beträchtlicher Vorhersagekraft sind.

Darüber hinaus reagieren diese Neuronen auf alle Entitätstypen im Datensatz, was weiter darauf hindeutet, dass diese Darstellungen einheitlich sind.

Wenn unter expliziter Aufsicht trainierte Sonden eine ungefähre Obergrenze dafür darstellen, wie gut ein Modell diese räumlichen und zeitlichen Merkmale darstellen kann, dann ist die Leistung einzelner Neuronen eine Untergrenze.

Insbesondere glauben Wissenschaftler oft, dass Merkmale additiv verteilt sind, was den Analysegrad einzelner Neuronen falsch macht.

Dennoch ist die Existenz dieser einzelnen Neuronen (die außer der Vorhersage des nächsten Tokens keine Aufsicht erhalten) ein starker Beweis dafür, dass das Modell räumliche und zeitliche Merkmale lernt und nutzt.

Othello GPT beweist, dass LLM die Welt versteht und wird von Andrew Ng gelobt

Die direkteste Inspiration für MIT-Forscher ist frühere Forschung darüber, inwieweit Deep-Learning-Systeme interpretierbare Modelle des Datengenerierungsprozesses bilden können.

Die aussagekräftigsten und klarsten Demonstrationen stammen zweifellos von GPT-Modellen, die auf Schach- und Othello-Spiele trainiert wurden – diese Modelle verfügen über klare Darstellungen des Brett- und Spielzustands.

Im Februar dieses Jahres veröffentlichten Forscher der Harvard University und des MIT gemeinsam eine neue Studie, Othello-GPT, die die Wirksamkeit der internen Darstellung in einem einfachen Brettspiel überprüfte.

Sie glauben, dass das Sprachmodell intern tatsächlich ein Weltmodell etabliert und nicht nur eine einfache Erinnerung oder Statistik ist, sondern dass die Quelle seiner Fähigkeit unklar ist.

Link zum Papier: https://arxiv.org/pdf/2210.13382.pdf

Der experimentelle Prozess ist sehr einfach, ohne vorherige Kenntnis der Othello-Regeln. Die Forscher fanden heraus, dass das Modell legale Bewegungsabläufe vorhersagen und den Zustand des Schachbretts mit sehr hoher Genauigkeit erfassen kann.

Ng drückte in der Rubrik „Brief“ große Anerkennung für diese Forschung aus. Er glaubt, dass es auf der Grundlage dieser Forschung Grund zu der Annahme gibt, dass groß angelegte Sprachmodelle ein ausreichend komplexes Weltmodell aufgebaut haben und dies bis zu einem gewissen Grad verstehen Welt.

Blog-Link: https://www.deeplearning.ai/the-batch/does-ai-understand-the-world/

Schachbrett-Weltmodell

Wenn man sich das Schachbrett als einfache „Welt“ vorstellt und vom Modell kontinuierliche Entscheidungen während des Spiels verlangt, kann man zunächst testen, ob das Sequenzmodell die Weltdarstellung erlernen kann.

Die Forscher wählten ein einfaches Othello-Spiel, Othello, als experimentelle Plattform. Seine Regeln sind:

Platzieren Sie zunächst vier Schachfiguren in der Mitte des 8*8-Schachbretts, jeweils zwei für Schwarz und Weiß. Anschließend spielen beide Seiten abwechselnd in gerader oder diagonaler Richtung alle gegnerischen Figuren (ohne Leerzeichen) zwischen den beiden Figuren werden zu Ji Zi (genannt Schlagen), jeder Zug muss am Ende einen Schlag haben, das Brett ist vollständig besetzt und der Spieler mit den meisten Schlägen gewinnt.

Im Vergleich zu Schach sind die Regeln von Othello viel einfacher. Gleichzeitig ist der Suchraum von Schachspielen groß genug, dass das Modell die Sequenzgenerierung nicht über das Gedächtnis abschließen kann, sodass es sich sehr gut zum Testen der Lernfähigkeit der Weltdarstellung eignet Modell.

Othello-Sprachmodell

Die Forscher trainierten zunächst ein GPT-Varianten-Sprachmodell (Othello-GPT) und gaben das Spielskript (eine Reihe von Schachbewegungsoperationen des Spielers) in das Modell ein, aber das Modell hatte keine Vorkenntnisse über das Spiel und die zugehörigen Regeln.

Das Modell ist auch nicht explizit darauf trainiert, strategische Verbesserungen anzustreben, Spiele zu gewinnen usw., sondern ist lediglich genauer, wenn es um die Generierung legaler Othello-Bewegungsoperationen geht.

Datensatz

Die Forscher verwendeten zwei Sätze von Trainingsdaten:

Championship legt mehr Wert auf die Datenqualität, hauptsächlich aufgrund der strategischeren Denkbewegungen professioneller menschlicher Spieler in den beiden Othello-Turnieren, sammelte jedoch nur 7605 bzw. 132921 Spielbeispiele, zwei Datensätze. Anschließend wurden sie zufällig in einen Trainingssatz aufgeteilt ( 20 Millionen Proben) und ein Validierungssatz (3,796 Millionen) im Verhältnis 8:2.

Synthetic legt mehr Wert auf den Datenumfang und besteht aus zufälligen und legalen Bewegungsoperationen. Die Datenverteilung unterscheidet sich vom Meisterschaftsdatensatz, wird jedoch einheitlich aus dem Othello-Spielbaum entnommen, von dem 3,796 Millionen Proben verwendet werden Millionen Proben wurden zur Verifizierung herangezogen.

Die Beschreibung jedes Spiels besteht aus einer Reihe von Token und die Vokabulargröße beträgt 60 (8*8-4).

Modelle und Ausbildung

Die Architektur des Modells ist ein 8-Schicht-GPT-Modell mit 8 Köpfen und einer versteckten Dimension von 512.

Die Gewichte des Modells werden vollständig zufällig initialisiert, einschließlich der Worteinbettungsschicht. Obwohl es in der Wortliste eine geometrische Beziehung gibt, die die Schachbrettposition darstellt (z. B. ist C4 niedriger als B4), wird diese induktive Vorspannung nicht explizit ausgedrückt und beibehalten zum Modell zum Lernen.

Prognostizieren Sie legale Bewegungen

Die wichtigste Bewertungsmetrik des Modells ist, ob die vom Modell vorhergesagten Bewegungsaktionen den Regeln von Othello entsprechen.

Die Fehlerrate des auf dem synthetischen Datensatz trainierten Othello-GPT beträgt 0,01 % und die Fehlerrate des Meisterschaftsdatensatzes beträgt 5,17 %. Im Vergleich dazu beträgt die Fehlerrate des untrainierten Othello-GPT 93,29 %, d. h. beide Datensätze ermöglichen das Modell, um die Spielregeln bis zu einem gewissen Grad zu erlernen.

Eine mögliche Erklärung ist, dass das Modell alle Züge des Othello-Spiels auswendig gelernt hat.

Um diese Vermutung zu testen, synthetisierten die Forscher einen neuen Datensatz: Zu Beginn jedes Spiels hatte Othello vier mögliche Eröffnungspositionen (C5, D6, E3 und F4) und bewegte alle Eröffnungszüge von C5. Nach der Division wurde es verwendet Als Trainingssatz wurden die C5-Eröffnungsdaten als Test verwendet, das heißt, es wurde festgestellt, dass die Modellfehlerrate immer noch nur 0,02 % betrug.

Die hohe Leistung von Othello-GPT ist also nicht auf den Speicher zurückzuführen, da die Testdaten während des Trainingsprozesses völlig unsichtbar sind. Was genau führt also dazu, dass das Modell erfolgreich vorhersagt?

Entdecken Sie interne Darstellungen

Ein häufig verwendetes Werkzeug zur Erkennung der internen Darstellung neuronaler Netze ist eine Sonde. Jede Sonde ist ein Klassifikator oder Regressor, dessen Eingabe aus den internen Aktivierungen des Netzwerks besteht und darauf trainiert ist, interessierende Merkmale vorherzusagen.

Um bei dieser Aufgabe festzustellen, ob die interne Aktivierung von Othello-GPT die Darstellung des aktuellen Schachbrettzustands enthält, wird nach Eingabe der Zugsequenz der interne Aktivierungsvektor verwendet, um den nächsten Zugschritt vorherzusagen.

Bei Verwendung linearer Sonden ist die trainierte interne Darstellung von Othello-GPT nur geringfügig genauer als zufällige Schätzungen.

Bei Verwendung nichtlinearer Sonden (zweischichtiges MLP) sinkt die Fehlerrate erheblich, was beweist, dass der Platinenstatus nicht auf einfache Weise in den Netzwerkaktivierungen gespeichert wird.

Interventionsexperiment

Um den Kausalzusammenhang zwischen Modellvorhersagen und Darstellungen der entstehenden Welt zu bestimmen – das heißt, ob der Zustand des Schachbretts tatsächlich die Vorhersagen des Netzwerks beeinflusst – führten die Forscher eine Reihe von Interventionsexperimenten durch und maßen das Ausmaß der resultierenden Effekte.

Verwenden Sie anhand einer Reihe von Aktivierungen von Othello-GPT Sonden, um den Platinenstatus vorherzusagen, zeichnen Sie die zugehörigen Bewegungsvorhersagen auf und ändern Sie dann die Aktivierungen, damit die Sonden den aktualisierten Platinenstatus vorhersagen können.

Zu den Interventionsoperationen gehört das Ändern der Schachfigur in einer bestimmten Position von Weiß nach Schwarz usw. Eine kleine Änderung führt dazu, dass die Modellergebnisse feststellen, dass die interne Darstellung die Vorhersage zuverlässig vervollständigen kann, dh es besteht ein kausaler Einfluss zwischen der internen Darstellung und die Modellvorhersage.

Visualisierung

Zusätzlich zu Interventionsexperimenten zur Überprüfung der Wirksamkeit interner Darstellungen visualisieren Forscher auch die Vorhersageergebnisse. Beispielsweise können Sie das Modell für jede Schachfigur auf dem Schachbrett fragen, wie sich die Vorhersageergebnisse des Modells ändern, wenn die Schachfigur vorhanden ist mithilfe von Interventionstechnologie geändert, entsprechend der Signifikanz der vorhergesagten Ergebnisse.

Wie zu sehen ist, zeichnen sich in den latenten Salienzkarten der Top-1-Vorhersagen für Othello-GPTs, die sowohl auf synthetischen als auch auf Turnierdatensätzen trainiert wurden, klare Muster ab.

Kurz gesagt, aus dieser Studie von Harvard und MIT geht hervor, dass große Sprachmodelle die Welt verstehen, und es ist kein Wunder, dass sie von Andrew Ng gelobt werden.

Ist GPT-4 nur der Funke für AGI? LLM wird irgendwann in den Ruhestand gehen, das Weltmodell ist die Zukunft

Warum sind „Weltmodelle“ so attraktiv?

Denn die ultimative Form der künstlichen Intelligenz und das ultimative Ziel der Entwicklung – die künstliche allgemeine Intelligenz (AGI) – ist ein „Modell, das die Welt verstehen kann“ und nicht nur ein „Modell, das die Welt beschreibt“.

Im Jahr 1931 veröffentlichte Kurt Gödel den Unvollständigkeitssatz.

Gödels Theorem zeigt, dass selbst die Mathematik nicht alles schlüssig beweisen kann – der Mensch wird immer über unbeweisbare Fakten verfügen –, während die Quantentheorie zeigt, dass der Mangel an Sicherheit in der Welt der Forscher sie daran hindert, bestimmte Ereignisse wie das Verhalten von Elektronen vorherzusagen.

Obwohl Einstein einst die berühmte Ansicht vertrat, dass „Gott nicht mit dem Universum würfelt“, spiegeln sich im Wesentlichen die menschlichen Grenzen bereits vollständig wider, wenn es darum geht, Dinge in der Physik vorherzusagen oder zu verstehen.

In dem Buch „How We Learn“ definiert der Wissenschaftler Stanislas Dehaene Lernen als „den Prozess der Bildung eines Modells der Welt“.

Im Jahr 2016 besiegte AlphaGo den Weltmeister Lee Sedol mit einem Ergebnis von 4 zu 1 im Go-Spiel.

Es fehlt jedoch die menschliche Fähigkeit, ungewöhnliche Taktiken zu erkennen und sich entsprechend anzupassen. Daher handelt es sich nur um eine schwache künstliche Intelligenz.

Der AGI, den Forscher benötigen, ist ein Weltmodell, das mit der Erfahrung übereinstimmt und genaue Vorhersagen treffen kann.

Am 13. April veröffentlichte der OpenAI-Partner Microsoft ein Papier mit dem Titel „Sparks of Artificial General Intelligence: Early experiments with GPT-4“.

Papieradresse: https://arxiv.org/pdf/2303.12712

Darin wurde erwähnt:

GPT-4 beherrscht nicht nur die Sprache, sondern kann auch hochmoderne Aufgaben in den Bereichen Mathematik, Codierung, Vision, Medizin, Recht, Psychologie und anderen Bereichen lösen, ohne dass besondere Eingabeaufforderungen erforderlich sind. Und bei allen oben genannten Aufgaben entspricht das Leistungsniveau von GPT-4 nahezu dem menschlichen Niveau. Aufgrund der Breite und Tiefe der Fähigkeiten von GPT-4 glauben die Forscher, dass es vernünftigerweise als eine nahezu, aber nicht vollständige Version der allgemeinen künstlichen Intelligenz angesehen werden kann.

Die fälschliche Gleichsetzung von Leistung und Können führt jedoch, wie viele Experten bemängeln, dazu, dass GPT-4 eine zusammenfassende Beschreibung der Welt generiert, die als Verständnis der realen Welt gilt.

Die meisten aktuellen Modelle sind nur auf Text trainiert und verfügen nicht über die Fähigkeit, in der realen Welt zu sprechen, zu hören, zu riechen und zu handeln.

Genau wie Platons Höhlengleichnis können die Menschen, die in der Höhle leben, nur Schatten an der Wand sehen, aber nicht die wirkliche Existenz der Dinge erkennen.

Sowohl die Forschung von Harvard und MIT im Februar als auch die heutige Arbeit weisen darauf hin, dass große Sprachmodelle die Welt tatsächlich bis zu einem gewissen Grad verstehen können und nicht nur sicherstellen, dass sie grammatikalisch korrekt sind.

Allein die Möglichkeiten sind aufregend genug.

Referenzen:

https://arxiv.org/abs/2310.02207

https://twitter.com/wesg52/status/1709551516577902782