El campo de los videos e imágenes aún no ha vivido un verdadero “momento GPT”, aunque las capacidades de los modelos multimodales mejoran de forma constante.
En un programa reciente del canal de Redpoint AI, Oriol Vinyals, vicepresidente de investigación de Google DeepMind y responsable conjunto de Google Gemini, señaló que, aunque los modelos actuales pueden procesar de forma mixta múltiples modalidades y lograr una interacción natural, la comprensión puramente visual todavía no alcanza la profundidad de los modelos de lenguaje.
▷ Los métodos de entrenamiento existentes ya incorporaron datos de video e imágenes; el modelo muestra comprensión de contexto prolongado y capacidad de edición entre modalidades. Sin embargo, el avance es más una integración progresiva que un salto disruptivo.
▷ El verdadero “momento GPT” debería referirse a la capacidad de extraer la semántica completa y la lógica causal únicamente a partir de datos visuales. En este punto, la comprensión que tiene el modelo del contenido visual aún es relativamente superficial y carece de una cadena de razonamiento profunda propia de los modelos de lenguaje.🪁
En un programa reciente del canal de Redpoint AI, Oriol Vinyals, vicepresidente de investigación de Google DeepMind y responsable conjunto de Google Gemini, señaló que, aunque los modelos actuales pueden procesar de forma mixta múltiples modalidades y lograr una interacción natural, la comprensión puramente visual todavía no alcanza la profundidad de los modelos de lenguaje.
▷ Los métodos de entrenamiento existentes ya incorporaron datos de video e imágenes; el modelo muestra comprensión de contexto prolongado y capacidad de edición entre modalidades. Sin embargo, el avance es más una integración progresiva que un salto disruptivo.
▷ El verdadero “momento GPT” debería referirse a la capacidad de extraer la semántica completa y la lógica causal únicamente a partir de datos visuales. En este punto, la comprensión que tiene el modelo del contenido visual aún es relativamente superficial y carece de una cadena de razonamiento profunda propia de los modelos de lenguaje.🪁
