Adobe Research は状態空間モデルで長期依存を扱い、さらに密なローカル注意を重ねて整合性を保ちます。diffusion forcing やフレームのローカル注意などの学習戦略と組み合わせることで、動画生成における長期記憶の問題に取り組んでいます。彼らはこれを長年の難所だと述べています。