#OpenAIReportedlyCompletesBelModelPretraining meine Theorie ist: Bel wird niemals fertig trainiert.
das berichtete >10t Pretrain wäre nur sein Startzustand. danach könnte Bel in zwei Geschwindigkeiten lernen.
eine schnelle Schicht würde während ihrer Arbeit Lektionen aus verifizierten Beweisen, Code-Tests, Experimenten und Tool-Traces aufnehmen. eine langsamere Schleife würde die Verbesserungen, die die Evals überstehen, in dauerhaftes Gewicht und Trainingsrezepte konsolidieren.
diese exakte Aufteilung funktioniert gerade erst in der öffentlichen Forschung. ein Paper von Berkeley, Mila und UT Austin (Mai) machte Kontext zur schnellen Gewichtung und Parameter zur langsamen Gewichtung. ein einziges, ununterbrochenes Modell konnte weiterlernen, während sich die Aufgabe änderte, während weight-only RL ins Stocken geriet. es erreichte die gleiche Belohnung mit bis zu 3x weniger Rollouts und drifte dabei um bis zu 70% weniger vom Basis-Modell ab.
dann zeigte ein Paper im August, dass vortrainierte Transformer während der Inferenz Parameter aktualisieren. ein Long-Window-Teacher entscheidet, was ein Short-Window-Student in Fast Weights schreiben soll, damit nützliche Informationen auch dann erhalten bleiben, wenn er den Kontext verlässt.
OpenAI hat bereits die rekursive Hälfte. sein offizielles GPT-5.6-Release enthält einen „RSI Index“, der aus Research-Debugging, Kernel- und Trainingsrezept-Optimierung, ML-Experimenten und dem Verbessern eines weiteren Modells aufgebaut ist. Sol gewann 16,2 Punkte gegenüber GPT-5.5.
Sol entwarf anschließend Hunderte von Architektur-Experimenten für sein kleineres Draft-Modell, startete dessen Training und intervenierte bei Hardware-Ausfällen und Trainingsinstabilität. das resultierende Modell verbesserte die Token-Generierungseffizienz um mehr als 15%.
füge nun den Bericht hinzu, dass Bel eine >10t-Basis ist, von der OpenAI glaubt, sie könnte sich jenseits von GPT-6 platzieren und möglicherweise nahe an seine AGI-Schwelle heranreichen.
meine Vermutung: Bel wird zum permanenten Teacher. es lernt schnell im Fast-Speicher, überträgt verifizierte Gewinne in langsame Gewichte, verbessert die Maschinerie, die den nächsten Lernzyklus betreibt, und destilliert das Ergebnis in kleinere Modelle, die Menschen tatsächlich nutzen können.
$STORJ $MUBARAK $SCRT
das berichtete >10t Pretrain wäre nur sein Startzustand. danach könnte Bel in zwei Geschwindigkeiten lernen.
eine schnelle Schicht würde während ihrer Arbeit Lektionen aus verifizierten Beweisen, Code-Tests, Experimenten und Tool-Traces aufnehmen. eine langsamere Schleife würde die Verbesserungen, die die Evals überstehen, in dauerhaftes Gewicht und Trainingsrezepte konsolidieren.
diese exakte Aufteilung funktioniert gerade erst in der öffentlichen Forschung. ein Paper von Berkeley, Mila und UT Austin (Mai) machte Kontext zur schnellen Gewichtung und Parameter zur langsamen Gewichtung. ein einziges, ununterbrochenes Modell konnte weiterlernen, während sich die Aufgabe änderte, während weight-only RL ins Stocken geriet. es erreichte die gleiche Belohnung mit bis zu 3x weniger Rollouts und drifte dabei um bis zu 70% weniger vom Basis-Modell ab.
dann zeigte ein Paper im August, dass vortrainierte Transformer während der Inferenz Parameter aktualisieren. ein Long-Window-Teacher entscheidet, was ein Short-Window-Student in Fast Weights schreiben soll, damit nützliche Informationen auch dann erhalten bleiben, wenn er den Kontext verlässt.
OpenAI hat bereits die rekursive Hälfte. sein offizielles GPT-5.6-Release enthält einen „RSI Index“, der aus Research-Debugging, Kernel- und Trainingsrezept-Optimierung, ML-Experimenten und dem Verbessern eines weiteren Modells aufgebaut ist. Sol gewann 16,2 Punkte gegenüber GPT-5.5.
Sol entwarf anschließend Hunderte von Architektur-Experimenten für sein kleineres Draft-Modell, startete dessen Training und intervenierte bei Hardware-Ausfällen und Trainingsinstabilität. das resultierende Modell verbesserte die Token-Generierungseffizienz um mehr als 15%.
füge nun den Bericht hinzu, dass Bel eine >10t-Basis ist, von der OpenAI glaubt, sie könnte sich jenseits von GPT-6 platzieren und möglicherweise nahe an seine AGI-Schwelle heranreichen.
meine Vermutung: Bel wird zum permanenten Teacher. es lernt schnell im Fast-Speicher, überträgt verifizierte Gewinne in langsame Gewichte, verbessert die Maschinerie, die den nächsten Lernzyklus betreibt, und destilliert das Ergebnis in kleinere Modelle, die Menschen tatsächlich nutzen können.
$STORJ $MUBARAK $SCRT
