动察 Última hora de noticias sobre IA: el laboratorio de IA Banbury Road presenta Kardashev-0.7, compuesto por 32 modelos diferentes. El equipo entrenó estos modelos conjuntamente mediante aprendizaje por refuerzo, sin definir de antemano las responsabilidades de cada uno, lo que les permitió desarrollar distintas especialidades y capacidades complementarias durante el entrenamiento. Este método se denomina RL for Population Scaling (RLPS). Los experimentos anteriores con RLPS escalaron hasta un máximo de 16 modelos. En un experimento con 8 modelos, la población de modelos obtuvo una puntuación del 81,70 % tras el entrenamiento conjunto, superior al 71,04 % de 8 modelos entrenados de forma independiente y también al 72,65 % obtenido al muestrear repetidamente el mismo modelo 8 veces. En el experimento con 16 modelos, hubo 22 preguntas que solo uno de los modelos respondió correctamente, lo que demuestra que los distintos modelos sí aprendieron habilidades diferentes. Kardashev-0.7 amplía la escala a 32 modelos. Banbury Road afirma que puede alcanzar un rendimiento propio de los modelos de vanguardia con un coste de inferencia entre 0,007 y 0,02 veces menor, y usando 0,03 veces la memoria. Por ahora, para acceder a la beta de la API todavía hay que apuntarse a una lista de espera. Sin embargo, las puntuaciones de las poblaciones en los experimentos anteriores con 8 y 16 modelos se obtuvieron seleccionando, a posteriori, el mejor resultado entre varias respuestas de los modelos mediante las respuestas correctas de referencia. En el uso real no hay respuestas de referencia, y Banbury Road aún no ha divulgado públicamente un plan completo para que el sistema seleccione automáticamente la respuesta correcta.