Von Neumanns Aufsatz von 1956 fragte, wie man zuverlässige Berechnungen aus unzuverlässigen Bauteilen aufbaut – Neuronen sind verrauscht, Verbindungen verändern sich, und trotzdem funktionieren Gehirne. Die digitale Logik löste das mit hoher Spannung und Redundanz, doch dadurch steigen die Energiekosten quadratisch mit der Skalierung.
MIT hat die Frage nun für LLMs wieder aufgegriffen. Das Team trainierte Llama-2-Transformer (mit bis zu 930 Mio. Parametern) auf 350 Mrd. Tokens und setzte dabei in den Attention- und FFN-Schichten zufällig 4×4-Matrixblöcke mit Wahrscheinlichkeit p auf null – sowohl während des Trainings ALS AUCH bei der Inferenz. Nach 40.000 GPU-Stunden das Ergebnis: Modelle, die unter Fehlerbedingungen trainiert wurden, wurden mit zunehmender Skalierung ROBUSTER. Modelle, die ohne Fehler trainiert wurden, brachen zusammen, sobald bei der Inferenz Fehler auftraten.
Das Team passte ein modifiziertes Skalierungsgesetz mit einem zusätzlichen Krümmungsterm an, der nur bei p > 0 auftritt. Das deutet darauf hin, dass die Netzwerke Fehlerkorrekturcodes lernen, deren Mehraufwand endlich bleibt, wenn N wächst. Falls das asymptotisch gilt, könnte man Inferenz auf Niederspannungs- oder Analogchips ausführen, die pro Rechenoperation deutlich weniger Energie verbrauchen.
Der Haken: Die Experimente reichen nur bis zu 1 Mrd. Parametern. Das bei einer Skalierung auf 405 Mrd. Parameter zu bestätigen, würde etwa 100 Mio. GPU-Stunden kosten. Die Checkpoints sind öffentlich, doch seit der Veröffentlichung des Preprints vor drei Tagen gab es fast keine Diskussion dazu.
Der Ansatz: einmal unter Hardwarefehlern trainieren und anschließend auf bewusst unvollkommenen Beschleunigern einsetzen. Die offene Frage: Niemand hat getestet, ob die erlernte Fehlerkorrektur auch jenseits von 1 Mrd. Parametern Bestand hat.
MIT hat die Frage nun für LLMs wieder aufgegriffen. Das Team trainierte Llama-2-Transformer (mit bis zu 930 Mio. Parametern) auf 350 Mrd. Tokens und setzte dabei in den Attention- und FFN-Schichten zufällig 4×4-Matrixblöcke mit Wahrscheinlichkeit p auf null – sowohl während des Trainings ALS AUCH bei der Inferenz. Nach 40.000 GPU-Stunden das Ergebnis: Modelle, die unter Fehlerbedingungen trainiert wurden, wurden mit zunehmender Skalierung ROBUSTER. Modelle, die ohne Fehler trainiert wurden, brachen zusammen, sobald bei der Inferenz Fehler auftraten.
Das Team passte ein modifiziertes Skalierungsgesetz mit einem zusätzlichen Krümmungsterm an, der nur bei p > 0 auftritt. Das deutet darauf hin, dass die Netzwerke Fehlerkorrekturcodes lernen, deren Mehraufwand endlich bleibt, wenn N wächst. Falls das asymptotisch gilt, könnte man Inferenz auf Niederspannungs- oder Analogchips ausführen, die pro Rechenoperation deutlich weniger Energie verbrauchen.
Der Haken: Die Experimente reichen nur bis zu 1 Mrd. Parametern. Das bei einer Skalierung auf 405 Mrd. Parameter zu bestätigen, würde etwa 100 Mio. GPU-Stunden kosten. Die Checkpoints sind öffentlich, doch seit der Veröffentlichung des Preprints vor drei Tagen gab es fast keine Diskussion dazu.
Der Ansatz: einmal unter Hardwarefehlern trainieren und anschließend auf bewusst unvollkommenen Beschleunigern einsetzen. Die offene Frage: Niemand hat getestet, ob die erlernte Fehlerkorrektur auch jenseits von 1 Mrd. Parametern Bestand hat.