La comunidad matemática se pregunta hasta qué punto se puede confiar en los 719 manuscritos matemáticos generados por IA que publicó OpenAI. La duda surgió después de que un artículo reciente señalara que la demostración de las ecuaciones de Navier-Stokes publicada anteriormente por OpenAI no coincide exactamente con el código Lean verificado por ordenador.
Puntos clave
Al descubrirse un error de signo, los manuscritos matemáticos de IA de OpenAI pasaron de 722 a 719.
Tres matemáticos británicos encontraron dos puntos en los que la demostración escrita de Navier-Stokes no coincide con el código Lean.
Los autores del artículo no afirman que la prueba en sí sea incorrecta, pero subrayan que la verificación mecánica no puede sustituir la revisión por pares.
La publicación de las matemáticas de IA de OpenAI
OpenAI publicó el 6 de octubre una gran colección de pruebas matemáticas. Más tarde, un informe de análisis publicado el jueves señaló que parte de este trabajo se apartaba de las directrices propuestas para los laboratorios de IA por un panel independiente de matemáticos. El catálogo incluía inicialmente 722 trabajos, pero OpenAI retiró tres después de detectar errores de signo que invalidaban un razonamiento y afectaban también a otros dos trabajos que dependían de él.
Estas directrices fueron publicadas el 29 de septiembre por el Advisory Group on Mathematics and Artificial Intelligence, compuesto por nueve miembros. Desde su primera frase, instan a los laboratorios a «no poner a prueba modelos comerciales cerrados con problemas matemáticos avanzados». En cambio, el repositorio de OpenAI indica que estos artículos son el resultado de aplicar modelos internos no públicos a problemas de investigación inéditos.
Solo 10 de todos los resultados incluyen una explicación que resume el proceso de razonamiento del modelo. Apenas alrededor del 42 % de los principales resultados finales están formalizados en Lean, un lenguaje de programación que permite verificar mecánicamente las pruebas matemáticas.
Para leer también: ¿Cuánto gana al año el CEO de Anthropic? El paquete de compensación que revelan los documentos de la salida a bolsa
La prueba de Navier-Stokes: dónde se torció
**Alexander Bastounis**, del King's College de Londres, y Fabian Circelli y **Anders Hansen**, de la Universidad de Cambridge, examinaron detenidamente una prueba relacionada con las ecuaciones de Navier-Stokes que OpenAI anunció como «resuelta» en septiembre pasado. Encontraron dos puntos en los que el artículo escrito y el código Lean divergían. En uno de ellos, el código Lean resultó demostrar únicamente una estimación más débil que la que afirmaba el artículo.
Los autores se abstuvieron de pronunciarse sobre si las pruebas escritas eran correctas o incorrectas. La cuestión es más acotada: Lean puede confirmar que el teorema final es válido, pero no garantiza que todos los pasos intermedios de la demostración, tal como los lee una persona, sean correctos. Por eso, subrayan que incluso este tipo de pruebas asistidas por IA debe someterse, en última instancia, a la revisión por pares humana.
El ganador de la Medalla Fields **Terence Tao** criticó en una publicación del 6 de octubre que los problemas actuales estén siendo resueltos por «prompters de IA» que no comprenden suficientemente los resultados y, por ello, tienen dificultades incluso para responder preguntas o presentar su trabajo en seminarios. Melanie Matchett Wood, profesora de Harvard y miembro del grupo asesor, también afirmó que, cuando se hacen públicos estos resultados, «todavía nadie comprende el panorama completo; el verdadero trabajo empieza ahora».
La prueba de OpenAI, envuelta en una disputa de confianza
El grupo asesor ha dejado claro que, en última instancia, corresponde a toda la comunidad matemática en sentido amplio decidir hasta qué punto OpenAI siguió sus recomendaciones. Esta polémica sobre la verificación llega tras un mes ya marcado por una tensión creciente.
OpenAI anunció sus resultados sobre Navier-Stokes el 8 de septiembre, lo que enseguida derivó en una disputa sobre la atribución del mérito con **Tristan Buckmaster**, matemático de la Universidad de Nueva York. Tres días después del anuncio, 25 ganadores de la Medalla Fields publicaron una declaración conjunta en la que advertían que la producción masiva de resultados matemáticos mediante IA podía perjudicar el ecosistema académico.
Siguiente artículo: Los 722 artículos de matemáticas generados por IA de OpenAI ya son públicos; ahora les toca evaluarlos a los matemáticos
