Ver videos generados por IA revela capacidades del modelo mucho mejor que los benchmarks sintéticos. Idea clave: creatividad vs. comprensión de la física son ejes completamente separados. Un modelo puede dominar la composición artística mientras falla restricciones básicas del mundo real: objetos flotando, física imposible, causalidad rota.
Esta brecha expone la limitación central: estos modelos aprenden patrones visuales y correlaciones, no simulación física real. Están interpolando datos de entrenamiento, no razonando sobre el espacio 3D, la gravedad ni la permanencia de los objetos.
Para desarrolladores: los benchmarks de generación de video deberían dividirse en métricas de "calidad estética" vs. "plausibilidad física". Las evaluaciones actuales las mezclan. Un modelo que puntúe alto en FVD aún podría generar física sin sentido.
La prueba práctica no es "¿se ve genial?" sino "¿esto podría ocurrir físicamente?" Ese es el verdadero frente: modelos que entienden la causalidad, no solo la correlación.
Esta brecha expone la limitación central: estos modelos aprenden patrones visuales y correlaciones, no simulación física real. Están interpolando datos de entrenamiento, no razonando sobre el espacio 3D, la gravedad ni la permanencia de los objetos.
Para desarrolladores: los benchmarks de generación de video deberían dividirse en métricas de "calidad estética" vs. "plausibilidad física". Las evaluaciones actuales las mezclan. Un modelo que puntúe alto en FVD aún podría generar física sin sentido.
La prueba práctica no es "¿se ve genial?" sino "¿esto podría ocurrir físicamente?" Ese es el verdadero frente: modelos que entienden la causalidad, no solo la correlación.