O campo de vídeo e imagens ainda não viveu um verdadeiro “momento GPT”, apesar de as capacidades de modelos multimodais estarem melhorando de forma constante.

Em um programa recente no canal da Redpoint AI, Oriol Vinyals, vice-presidente de pesquisa da Google DeepMind e co-líder do Google Gemini, apontou que, embora os modelos atuais consigam lidar de forma integrada com múltiplas modalidades e promover interações naturais, a compreensão puramente visual ainda não atingiu a profundidade dos modelos de linguagem.

▷ Os métodos de treinamento existentes já incorporaram dados de vídeo e imagem, e o modelo demonstra entendimento de contexto de longo alcance e capacidade de edição entre modalidades; porém, o avanço é mais uma fusão gradual do que uma ruptura explosiva.

▷ O verdadeiro “momento GPT” deve se referir à capacidade de extrair a semântica completa e a lógica causal apenas com dados visuais. Atualmente, a compreensão do modelo sobre o conteúdo visual ainda é relativamente superficial, faltando-lhe a cadeia de raciocínio em profundidade típica dos modelos de linguagem.🪁