Los modelos de video de IA todavía no pueden respetar de manera fiable las leyes de la física, según una evaluación comparativa publicada el martes por investigadores en arXiv.
Conclusiones clave
Se probaron ocho modelos de generación de video con 1.280 videos y 40 tareas controladas de física
El modelo con mejor rendimiento obtuvo 57,76 de 100 en coherencia física
La evaluación compara los resultados con relaciones físicas medibles, en lugar de basarse en el criterio humano o en videos de referencia
Los modelos que resolvieron razonablemente bien los conceptos básicos de mecánica siguieron teniendo dificultades con los fluidos y los cambios térmicos
El estudio, titulado «El examen final de física de los modelos del mundo», evaluó ocho modelos de generación de video con 1.280 videos y descubrió que el mejor obtuvo apenas 57,76 puntos sobre 100 en consistencia física. El artículo abarca 40 tareas controladas de mecánica, óptica, fluidos, comportamiento térmico, electromagnetismo y tensión superficial.
Los modelos de video de IA, a menudo llamados modelos del mundo, generan secuencias de video destinadas a simular cómo se comportan los entornos reales a lo largo del tiempo.
Cada vez más, los investigadores quieren utilizarlos para la planificación y la predicción en robótica y otros sistemas de IA incorporada, donde una máquina necesita anticipar cómo se moverán los objetos antes de actuar.
Los autores del benchmark crearon un evaluador que combina una imagen inicial y una instrucción con criterios físicos predefinidos, y luego puntúa el resultado según relaciones físicas medibles, en vez de basarse en el juicio humano o en videos de referencia. Este enfoque permitió al equipo evaluar relaciones observables de causa y efecto, como si un objeto soltado acelera correctamente o si un líquido se comporta de forma coherente al verterse.
Por qué una puntuación de 57,76 es un problema mayor de lo que parece
Una puntuación cercana a 58 sobre 100 significa que el modelo más sólido de los ocho evaluados acertó en las interacciones físicas poco más de la mitad de las veces.
Esa brecha importa porque los modelos de mundo para video se promocionan como herramientas para la planificación robótica, donde la simulación interna de un modelo guía una acción física.
Lea también: Aleph Alpha presenta Kolibri, un modelo europeo soberano de pesos abiertos
Si un modelo calcula sistemáticamente mal la velocidad a la que cae algo o cómo se dispersa un fluido, cualquier sistema construido sobre él hereda los mismos errores. Los investigadores descubrieron que el evaluador coincidía más estrechamente con los juicios humanos que un modelo de referencia de visión y lenguaje, tanto al clasificar videos dentro de una misma tarea como en comparaciones directas.
Del realismo visual a la verdad física
Los primeros benchmarks para modelos de generación de video evaluaban sobre todo la calidad visual —la nitidez, la coherencia o el atractivo estético de un clip—, en lugar de comprobar si los sucesos representados obedecían las leyes físicas.
En cambio, este benchmark aísla la física como una categoría medible por sí misma y la divide en ámbitos como los fenómenos térmicos y los cambios de fase, para los que la mayoría de las herramientas de evaluación anteriores ni siquiera tenían pruebas específicas.
Los investigadores validaron su módulo de medición con videos sintéticos cuyos resultados físicos eran conocidos antes de aplicarlo a los ocho modelos de nivel comercial. Este paso buscaba confirmar la fiabilidad del propio sistema de puntuación antes de usarlo para evaluar la IA.
La brecha entre obtener 100 puntos en un benchmark de física y el despliegue en el mundo real sigue siendo amplia. Los investigadores señalaron una «variación sustancial» entre las 40 tareas: los modelos que resolvían razonablemente bien la mecánica básica seguían tropezando con los fluidos y los cambios térmicos.
Es probable que las futuras versiones del benchmark amplíen la cobertura de tareas a medida que más laboratorios publiquen sistemas de generación de video diseñados para tareas de robótica y simulación.
Lea a continuación: Dos palabras casi duplican la puntuación de un modelo lingüístico en matemáticas