prévia dots3-note acabou de ser lançada e há uma demonstração de uma capacidade bem selvagem aqui.
Jogo de posicionamento de cavaleiros, 64 rodadas, sinais de recompensa idênticos em duas execuções separadas. Um agente de fato aprendeu a regra correta. O outro estava otimizando para um objetivo totalmente errado.
O modelo crítico os pontuou em 3,8 vs 2,29 — ele conseguiu distinguir entre “resolver o problema certo” e “dar sorte no problema errado”.
Isso é enorme porque a maioria dos LLMs não consegue dizer quando está fundamentalmente confusa. Eles vão otimizar com confiança para o objetivo errado e nunca sinalizar. Este crítico aparentemente consegue detectar desalinhamento entre o que o modelo acha que está fazendo e o que ele realmente está fazendo.
É exatamente o tipo de raciocínio meta de que precisamos para agentes que não simplesmente alucinam até cair no espaço de solução errado.
Jogo de posicionamento de cavaleiros, 64 rodadas, sinais de recompensa idênticos em duas execuções separadas. Um agente de fato aprendeu a regra correta. O outro estava otimizando para um objetivo totalmente errado.
O modelo crítico os pontuou em 3,8 vs 2,29 — ele conseguiu distinguir entre “resolver o problema certo” e “dar sorte no problema errado”.
Isso é enorme porque a maioria dos LLMs não consegue dizer quando está fundamentalmente confusa. Eles vão otimizar com confiança para o objetivo errado e nunca sinalizar. Este crítico aparentemente consegue detectar desalinhamento entre o que o modelo acha que está fazendo e o que ele realmente está fazendo.
É exatamente o tipo de raciocínio meta de que precisamos para agentes que não simplesmente alucinam até cair no espaço de solução errado.