AI生成视频时的记忆策略创新:浙大与港大联合成果
在视频生成领域,仅能连续生成一分钟的长视频并不足以满足真实需求。真正的挑战在于主角离开镜头后再回归时,AI可能会错误地改变角色的外观和服装,甚至遗忘原本需回归的物体。这种状况的产生源于自回归视频模型在生成画面时只能依靠局部的上下文缓存,而近日,浙江大学与香港大学的团队提出了一种新的方法——LayerRecall,它不再简单地将历史信息全部输入模型,而是结合两个关键问题进行处理:现在需要记住什么?这些记忆该如何在不同层中使用?
LayerRecall的创新在于能够更有效地从历史中提取相关记忆,并准确判断将记忆传递到哪些特定视频处理层。通过一系列评估,该方法在主体、颜色、位置和场景四大类长时记忆测试中,表现优于现有的基线模型,最终在多个指标上取得了领先的成绩。此外,该方法在保证模型生成质量的同时,具有良好的计算效率。
LayerRecall的设计也揭示了一些反直觉的发现:记忆并非越多越好,而是需要有选择地使用。团队通过对LongLive-2.0模型的逐层分析,发现不同层对历史信息的依赖程度并不相同,某些层更关注当前和近期的画面,维护运动的连贯性,而另一些层则需要长时记忆来增强效果。 球友会登录
LayerRecall通过两条重要路径来优化记忆处理。一是确定“现在该想起什么”,通过建立历史摘要并寻找最相关的记忆;二是确定“记忆如何被使用”,将选中的历史信息传递到特定层,提升生成效果。该研究展现了在长视频生成时,如何更精细地管理和利用记忆,未来有望推动视频合成技术的进一步发展。