La respuesta es sí, y el efecto es bastante evidente. Entrenando con un solo idioma, el modelo también se vuelve más fuerte en muchos otros idiomas.

Por ejemplo, en las pruebas de francés: entrenando directamente con francés, el rendimiento promedio mejora 25.6 puntos porcentuales; sin entrenar nada en francés y usando únicamente ejercicios en español, al final al hacer el examen de francés también mejora 24.6 puntos porcentuales, solo por 1 punto porcentual.

Lo que el modelo aprende no es solo sobre los ejercicios de un idioma en particular, sino también una parte de los métodos para resolver problemas que se pueden cambiar de idioma y seguir usando. Así que en el futuro, si quieres reforzar el razonamiento del modelo en chino, quizá no sea necesario rehacer todo el conjunto de datos de aprendizaje por refuerzo en chino.

Pero tampoco se puede cambiar el entrenamiento del lenguaje a la ligera; un lenguaje específico puede, efectivamente, desencadenar una degradación de capacidades específicas. Con el mismo aprendizaje por refuerzo, si se cambia el lenguaje de entrenamiento, algunos modelos en realidad empeoran de forma notable en otros lenguajes y tareas. En el conjunto de experimentos más extremo, después de entrenar Qwen3-4B con suajili, un conjunto de pruebas de inglés que no habían visto durante el entrenamiento cayó 19.2 puntos porcentuales; y cuando se entrenó en conjunto con varios idiomas, esa prueba aumentó en cambio 4.5 puntos porcentuales.

El principal tipo de preguntas que valida este artículo son problemas de razonamiento en los que las respuestas, como matemáticas, lógica, gráficos y geometría, pueden evaluarse automáticamente para determinar si son correctas o no. Cuando esas preguntas se cambian a otro idioma, por lo general no cambia la solución subyacente. Para tareas que dependen realmente del lenguaje en sí, como comprensión lectora, metáforas, juicios semánticos y conocimiento cultural, el artículo no lo verifica.

El ex investigador senior de Google DeepMind y cofundador y CEO de Unreasonable Labs, Cao Yuan, considera que la IA para la ciencia está entrando en una etapa de explosión. Pero para que la IA logre hacer por sí sola descubrimientos científicos del nivel de un Premio Nobel, al menos aún se requieren dos o tres décadas. Cao Yuan ya había participado anteriormente en proyectos como Gemini, y la dirección de su emprendimiento ahora también busca que la IA descubra nuevos conocimientos.

Él cree que el mayor cuello de botella en este momento es la verificación. Escribir código permite ejecutar pruebas al instante, y las matemáticas incluso pueden revisarse paso a paso con Lean. Pero la biología, los materiales y la física, en última instancia, requieren experimentos reales. Un experimento puede ser muy caro o tardar mucho, y la IA no puede probar y equivocarse de manera continua y rápida como un Coding Agent.

Lo más difícil es «crear nuevos conceptos». Cao Yuan considera que ahora los modelos son muy buenos buscando respuestas dentro de conocimientos, definiciones y teoremas existentes, pero todavía no son capaces de abstraer nuevos objetos matemáticos, definiciones y teorías como lo haría un científico de primer nivel. Él llama a esta «abstracción de conceptos» la «última milla» hacia la AGI.