#OpenAIReportedlyCompletesBelModelPretraining minha teoria é gpt bel nunca vai terminar o treinamento.

a prévia reportada >10t de pré-treinamento seria apenas seu estado inicial. depois disso, bel poderia aprender em dois ritmos.

uma camada rápida absorveria lições de provas verificadas, testes de código, experimentos e rastros de ferramentas enquanto ela trabalha. um ciclo lento consolidaria as melhorias que sobrevivem às avaliações em pesos persistentes e receitas de treinamento.

essa divisão exata acabou de começar a funcionar em pesquisa pública. um artigo de maio da Berkeley, Mila e UT Austin fez do contexto os pesos rápidos e dos parâmetros os pesos lentos. um modelo ininterrupto continuou aprendendo conforme a tarefa mudava, enquanto RL apenas com pesos estagnou. ele atingiu a mesma recompensa com até 3x menos rollouts e reduziu o desvio em até 70% em relação ao modelo base.

então, um artigo de agosto mostrou transformers pré-treinados atualizando parâmetros durante a inferência. um professor de janela longa decide o que um aluno de janela curta deve escrever nos pesos rápidos para que informações úteis permaneçam após ele sair do contexto.

a openai já tem a metade recursiva. seu lançamento oficial do gpt-5.6 inclui um “RSI Index” construído a partir de pesquisa de depuração, otimização de kernels e receitas de treinamento, experimentos de ML e melhoria de outro modelo. sol ganhou 16,2 pontos sobre o gpt-5.5.

depois, sol projetou centenas de experimentos de arquitetura para seu modelo menor de rascunho, iniciou seu treinamento e interveio diante de falhas de hardware e instabilidade de treinamento. o modelo resultante melhorou a eficiência de geração de tokens em mais de 15%.

agora adicione o relato de que bel é uma >10t base que a openai acredita poder ficar além do gpt-6 e talvez perto do limite do seu AGI.

minha aposta é que bel se torne o professor permanente. ele aprende rápido na memória rápida, move ganhos verificados para pesos lentos, melhora a maquinaria que roda o próximo ciclo de aprendizado e destila o resultado em modelos menores que as pessoas realmente conseguem usar.
$STORJ $MUBARAK $SCRT