prévia dots3-note acabou de ser lançada e há uma demonstração de uma capacidade bem selvagem aqui.

Jogo de posicionamento de cavaleiros, 64 rodadas, sinais de recompensa idênticos em duas execuções separadas. Um agente de fato aprendeu a regra correta. O outro estava otimizando para um objetivo totalmente errado.

O modelo crítico os pontuou em 3,8 vs 2,29 — ele conseguiu distinguir entre “resolver o problema certo” e “dar sorte no problema errado”.

Isso é enorme porque a maioria dos LLMs não consegue dizer quando está fundamentalmente confusa. Eles vão otimizar com confiança para o objetivo errado e nunca sinalizar. Este crítico aparentemente consegue detectar desalinhamento entre o que o modelo acha que está fazendo e o que ele realmente está fazendo.

É exatamente o tipo de raciocínio meta de que precisamos para agentes que não simplesmente alucinam até cair no espaço de solução errado.