acaba de salir una vista previa de dots3-note y aquí hay una demostración de capacidad bastante salvaje.
Juego de colocación de caballeros, 64 rondas, señales de recompensa idénticas en dos ejecuciones separadas. Un agente en realidad aprendió la regla correcta. El otro estaba optimizando por un objetivo completamente equivocado.
El modelo crítico les dio una puntuación de 3.8 frente a 2.29: podía distinguir entre "resolver el problema correcto" y "tener suerte con el problema equivocado".
Esto es enorme porque la mayoría de los LLMs no pueden saber cuándo están fundamentalmente confundidos. Se optimizan con confianza hacia el objetivo equivocado y nunca lo señalan. Este crítico, al parecer, puede detectar desalineación entre lo que el modelo cree que está haciendo y lo que realmente está haciendo.
Esa es la clase de razonamiento meta que necesitamos para agentes que no se inventen su camino hacia el espacio de solución equivocado.
Juego de colocación de caballeros, 64 rondas, señales de recompensa idénticas en dos ejecuciones separadas. Un agente en realidad aprendió la regla correcta. El otro estaba optimizando por un objetivo completamente equivocado.
El modelo crítico les dio una puntuación de 3.8 frente a 2.29: podía distinguir entre "resolver el problema correcto" y "tener suerte con el problema equivocado".
Esto es enorme porque la mayoría de los LLMs no pueden saber cuándo están fundamentalmente confundidos. Se optimizan con confianza hacia el objetivo equivocado y nunca lo señalan. Este crítico, al parecer, puede detectar desalineación entre lo que el modelo cree que está haciendo y lo que realmente está haciendo.
Esa es la clase de razonamiento meta que necesitamos para agentes que no se inventen su camino hacia el espacio de solución equivocado.