En los artículos más populares de hoy, la mejora recursiva de sí mismo en este trabajo merece que lo desarmes. El modelo ya no depende de que le den datos, sino que se crea sus propias preguntas, responde y corrige, y luego usa la versión ya corregida para enseñar a la siguiente generación. En la industria, este tipo de iteración personal se llama «destilación por políticas».
Al ponerlo en la cadena, esta línea apunta directamente a $FET y $TAO . El primero reúne varios agentes en un solo equipo, y justo necesita que cada agente pueda iterar por sí mismo; el segundo traslada el proceso de entrenamiento a la cadena, haciendo que los que aportan capacidad de cómputo reciban recompensas según su contribución. Cuanto más demuestre el paper que la mejora automática puede funcionar, más puntos reales tendrá la división del trabajo en cadena.
Este paper, en cierto modo, añade otro ladrillo más a ese camino de septiembre.
#递归自改进 #智能体蒸馏 #AI
Al ponerlo en la cadena, esta línea apunta directamente a $FET y $TAO . El primero reúne varios agentes en un solo equipo, y justo necesita que cada agente pueda iterar por sí mismo; el segundo traslada el proceso de entrenamiento a la cadena, haciendo que los que aportan capacidad de cómputo reciban recompensas según su contribución. Cuanto más demuestre el paper que la mejora automática puede funcionar, más puntos reales tendrá la división del trabajo en cadena.
Este paper, en cierto modo, añade otro ladrillo más a ese camino de septiembre.
#递归自改进 #智能体蒸馏 #AI

