#OpenAIReportedlyCompletesBelModelPretraining minha teoria é gpt bel nunca vai terminar o treinamento.
a prévia reportada >10t de pré-treinamento seria apenas seu estado inicial. depois disso, bel poderia aprender em dois ritmos.
uma camada rápida absorveria lições de provas verificadas, testes de código, experimentos e rastros de ferramentas enquanto ela trabalha. um ciclo lento consolidaria as melhorias que sobrevivem às avaliações em pesos persistentes e receitas de treinamento.
essa divisão exata acabou de começar a funcionar em pesquisa pública. um artigo de maio da Berkeley, Mila e UT Austin fez do contexto os pesos rápidos e dos parâmetros os pesos lentos. um modelo ininterrupto continuou aprendendo conforme a tarefa mudava, enquanto RL apenas com pesos estagnou. ele atingiu a mesma recompensa com até 3x menos rollouts e reduziu o desvio em até 70% em relação ao modelo base.
então, um artigo de agosto mostrou transformers pré-treinados atualizando parâmetros durante a inferência. um professor de janela longa decide o que um aluno de janela curta deve escrever nos pesos rápidos para que informações úteis permaneçam após ele sair do contexto.
a openai já tem a metade recursiva. seu lançamento oficial do gpt-5.6 inclui um “RSI Index” construído a partir de pesquisa de depuração, otimização de kernels e receitas de treinamento, experimentos de ML e melhoria de outro modelo. sol ganhou 16,2 pontos sobre o gpt-5.5.
depois, sol projetou centenas de experimentos de arquitetura para seu modelo menor de rascunho, iniciou seu treinamento e interveio diante de falhas de hardware e instabilidade de treinamento. o modelo resultante melhorou a eficiência de geração de tokens em mais de 15%.
agora adicione o relato de que bel é uma >10t base que a openai acredita poder ficar além do gpt-6 e talvez perto do limite do seu AGI.
minha aposta é que bel se torne o professor permanente. ele aprende rápido na memória rápida, move ganhos verificados para pesos lentos, melhora a maquinaria que roda o próximo ciclo de aprendizado e destila o resultado em modelos menores que as pessoas realmente conseguem usar.
$STORJ $MUBARAK $SCRT
a prévia reportada >10t de pré-treinamento seria apenas seu estado inicial. depois disso, bel poderia aprender em dois ritmos.
uma camada rápida absorveria lições de provas verificadas, testes de código, experimentos e rastros de ferramentas enquanto ela trabalha. um ciclo lento consolidaria as melhorias que sobrevivem às avaliações em pesos persistentes e receitas de treinamento.
essa divisão exata acabou de começar a funcionar em pesquisa pública. um artigo de maio da Berkeley, Mila e UT Austin fez do contexto os pesos rápidos e dos parâmetros os pesos lentos. um modelo ininterrupto continuou aprendendo conforme a tarefa mudava, enquanto RL apenas com pesos estagnou. ele atingiu a mesma recompensa com até 3x menos rollouts e reduziu o desvio em até 70% em relação ao modelo base.
então, um artigo de agosto mostrou transformers pré-treinados atualizando parâmetros durante a inferência. um professor de janela longa decide o que um aluno de janela curta deve escrever nos pesos rápidos para que informações úteis permaneçam após ele sair do contexto.
a openai já tem a metade recursiva. seu lançamento oficial do gpt-5.6 inclui um “RSI Index” construído a partir de pesquisa de depuração, otimização de kernels e receitas de treinamento, experimentos de ML e melhoria de outro modelo. sol ganhou 16,2 pontos sobre o gpt-5.5.
depois, sol projetou centenas de experimentos de arquitetura para seu modelo menor de rascunho, iniciou seu treinamento e interveio diante de falhas de hardware e instabilidade de treinamento. o modelo resultante melhorou a eficiência de geração de tokens em mais de 15%.
agora adicione o relato de que bel é uma >10t base que a openai acredita poder ficar além do gpt-6 e talvez perto do limite do seu AGI.
minha aposta é que bel se torne o professor permanente. ele aprende rápido na memória rápida, move ganhos verificados para pesos lentos, melhora a maquinaria que roda o próximo ciclo de aprendizado e destila o resultado em modelos menores que as pessoas realmente conseguem usar.
$STORJ $MUBARAK $SCRT
