视频与图像领域尚未迎来真正的「GPT 时刻」,尽管多模态模型能力稳步提升。
在 Redpoint AI 频道近期节目中,Google DeepMind 研究副总裁兼 Google Gemini 联合负责人 Oriol Vinyals 指出,当前模型虽能混合处理多种模态并实现自然交互,但纯视觉理解仍未达到语言模型的深度。
▷ 现有训练方法已纳入视频和图像数据,模型展现长上下文理解和跨模态编辑能力,但进步更多是渐进式融合而非爆发式突破。
▷ 真正的「GPT 时刻」应指仅凭纯视觉数据就能提取完整语义与因果逻辑,目前模型对视觉内容的理解仍较表层,缺乏语言模型的深层推理链条。🪁
在 Redpoint AI 频道近期节目中,Google DeepMind 研究副总裁兼 Google Gemini 联合负责人 Oriol Vinyals 指出,当前模型虽能混合处理多种模态并实现自然交互,但纯视觉理解仍未达到语言模型的深度。
▷ 现有训练方法已纳入视频和图像数据,模型展现长上下文理解和跨模态编辑能力,但进步更多是渐进式融合而非爆发式突破。
▷ 真正的「GPT 时刻」应指仅凭纯视觉数据就能提取完整语义与因果逻辑,目前模型对视觉内容的理解仍较表层,缺乏语言模型的深层推理链条。🪁
