Adobe Research menggunakan model ruang-keadaan untuk menangani dependensi jangka panjang, menambahkan perhatian lokal yang padat agar tetap konsisten, serta memadukan strategi pelatihan seperti diffusion forcing dan perhatian lokal per-bingkai untuk mengatasi masalah memori jangka panjang dalam generasi video. Mereka menyebut ini sebagai tantangan yang sulit untuk diatasi dalam jangka panjang.