#OpenAIReportedlyCompletesBelModelPretraining моя теория такая: bel никогда не закончит обучение.
заявленное >10t предобучение будет лишь его исходным состоянием. после этого bel сможет учиться на двух скоростях.
быстрый слой будет впитывать уроки из проверенных доказательств, тестов кода, экспериментов и трасс инструментов, пока он работает. более медленный цикл будет закреплять улучшения, которые проходят evals, в устойчивые веса и рецепты обучения.
этое точное разделение только что начало работать в публичных исследованиях. майский документ от Berkeley, Mila и UT Austin связал контекст с быстрыми весами и параметрами, а медленные веса — с контекст-зависимыми изменениями. одна непрерывная модель продолжала учиться, когда задача менялась, тогда как weight-only RL застопорился. она достигла той же награды с до 3 раз меньшим числом rollout’ов и ушла от базовой модели примерно на 70% меньше.
затем августовская работа показала, что предварительно обученные трансформеры обновляют параметры во время инференса. учитель с длинным окном решает, что должен записать в быстрые веса студент с коротким окном, чтобы полезная информация сохранилась после того, как контекст закончится.
у OpenAI уже есть рекурсивная половина. в официальном релизе gpt-5.6 есть «RSI Index», собранный из исследований по отладке, оптимизации ядра и тренировочного рецепта, ML-экспериментов и улучшения другой модели. sol набрал 16,2 пункта сверх gpt-5.5.
затем sol спроектировал сотни архитектурных экспериментов для своей более маленькой модели-черновика, запустил её обучение и вмешивался через отказы железа и нестабильность обучения. получившаяся модель улучшила эффективность генерации токенов более чем на 15%.
теперь добавьте к этому отчёт, что bel — это >10t базовый “openai считает”, который может оказаться за пределами gpt-6 и потенциально приблизиться к порогу своей AGI.
мой прогноз: bel станет постоянным учителем. он быстро учится в быстрой памяти, переносит проверенные выгоды в медленные веса, улучшает механизмы, запускающие следующий цикл обучения, и дистиллирует результат в более маленькие модели, которые люди реально смогут использовать.
$STORJ $MUBARAK $SCRT
заявленное >10t предобучение будет лишь его исходным состоянием. после этого bel сможет учиться на двух скоростях.
быстрый слой будет впитывать уроки из проверенных доказательств, тестов кода, экспериментов и трасс инструментов, пока он работает. более медленный цикл будет закреплять улучшения, которые проходят evals, в устойчивые веса и рецепты обучения.
этое точное разделение только что начало работать в публичных исследованиях. майский документ от Berkeley, Mila и UT Austin связал контекст с быстрыми весами и параметрами, а медленные веса — с контекст-зависимыми изменениями. одна непрерывная модель продолжала учиться, когда задача менялась, тогда как weight-only RL застопорился. она достигла той же награды с до 3 раз меньшим числом rollout’ов и ушла от базовой модели примерно на 70% меньше.
затем августовская работа показала, что предварительно обученные трансформеры обновляют параметры во время инференса. учитель с длинным окном решает, что должен записать в быстрые веса студент с коротким окном, чтобы полезная информация сохранилась после того, как контекст закончится.
у OpenAI уже есть рекурсивная половина. в официальном релизе gpt-5.6 есть «RSI Index», собранный из исследований по отладке, оптимизации ядра и тренировочного рецепта, ML-экспериментов и улучшения другой модели. sol набрал 16,2 пункта сверх gpt-5.5.
затем sol спроектировал сотни архитектурных экспериментов для своей более маленькой модели-черновика, запустил её обучение и вмешивался через отказы железа и нестабильность обучения. получившаяся модель улучшила эффективность генерации токенов более чем на 15%.
теперь добавьте к этому отчёт, что bel — это >10t базовый “openai считает”, который может оказаться за пределами gpt-6 и потенциально приблизиться к порогу своей AGI.
мой прогноз: bel станет постоянным учителем. он быстро учится в быстрой памяти, переносит проверенные выгоды в медленные веса, улучшает механизмы, запускающие следующий цикл обучения, и дистиллирует результат в более маленькие модели, которые люди реально смогут использовать.
$STORJ $MUBARAK $SCRT
