A Adobe Research usa modelos de espaço de estados para lidar com dependências de longo alcance, sobrepondo atenção local densa para manter a coerência, e combinando estratégias de treinamento como diffusion forcing e atenção local entre quadros. Tudo isso para resolver o problema de memória de longo prazo na geração de vídeo. Eles chamam isso de um desafio de longa duração.