Adobe Research 用状态空间模型处理长程依赖,叠上密集局部注意力保连贯,配合 diffusion forcing、帧局部注意力等训练策略,解视频生成里的长期记忆问题。他们称这是长期存在的难点。