Adobe Research utilise des modèles d’espace d’état pour traiter les dépendances à long terme, superpose une attention locale dense pour assurer la cohérence, et combine des stratégies d’entraînement telles que le diffusion forcing et l’attention locale par trame pour résoudre le problème de mémoire à long terme dans la génération de vidéos. Ils qualifient cela de difficulté persistante.