#OpenAIReportedlyCompletesBelModelPretraining ma théorie est que gpt bel ne finira jamais l’entraînement.

tel que rapporté, le pré-entraînement >10t ne serait que son état de départ. ensuite, bel pourrait apprendre à deux vitesses.

une couche rapide absorberait les leçons issues de preuves vérifiées, de tests de code, d’expériences et de traces d’outils pendant qu’elle fonctionne. une boucle plus lente consoliderait les améliorations qui survivent aux évaluations en poids persistants et en recettes d’entraînement.

ce découpage exact vient juste de commencer à fonctionner en recherche publique. un article de mai venant de Berkeley, Mila et de l’UT Austin a fait de la mémoire de contexte les poids rapides et des poids/paramètres lents les poids lents. un modèle continu a continué d’apprendre quand la tâche changeait, tandis que le RL à poids seulement stagnait. il a atteint la même récompense avec jusqu’à 3× moins de roulages et a dérivé jusqu’à 70% de moins par rapport au modèle de base.

puis, un article d’août a montré des transformeurs préentraînés qui mettent à jour les paramètres pendant l’inférence. un professeur à longue fenêtre décide quoi écrire dans les poids rapides pour qu’un élève à courte fenêtre conserve une information utile une fois qu’il quitte le contexte.

openai possède déjà la moitié récursive. sa publication officielle de gpt-5.6 inclut un « RSI Index » construit à partir du débogage de recherche, de l’optimisation du noyau et des recettes d’entraînement, des expériences ML et de l’amélioration d’un autre modèle. sol a gagné 16,2 points par rapport à gpt-5.5.

ensuite, sol a conçu des centaines d’expériences d’architecture pour son modèle de draft plus petit, a lancé son entraînement et est intervenu en cas de défaillances matérielles et d’instabilité d’entraînement. le modèle résultant a amélioré l’efficacité de génération de tokens de plus de 15%.

maintenant, ajoutez le rapport selon lequel bel est une >10t base que openai pense capable de dépasser gpt-6 et potentiellement de se rapprocher de son seuil d’AGI.

mon estimation est que bel devient le professeur permanent. il apprend rapidement en mémoire rapide, transfère les gains vérifiés vers les poids lents, améliore la machinerie qui exécute le prochain cycle d’apprentissage, puis distille le résultat dans des modèles plus petits que les gens peuvent réellement utiliser.
$STORJ $MUBARAK $SCRT