WorldDreamer无缝逐帧AI模型: 基于Transformer生成高质量电影级别视频的通用世界模型"

+AI动态 AIGC 网站公告
1月29日
🍔喜好值+
编辑

HeeHel喜好儿官方小编

WorldDreamer是一个基于Transformer的通用世界模型，能够完成自然场景和自动驾驶场景多种视频生成任务，如文生视频、图生视频、视频编辑、动作序列生视频等。该模型从20亿数据中学习物理世界，通过预测Token的方式建立通用场景世界模型，将视频生成转换为序列预测任务，从而对物理世界的变化和运动规律进行充分地学习。可视化实验证明，WorldDreamer深刻理解了通用世界的动态变化规律。

WorldDreamer无缝逐帧AI模型: 基于Transformer生成高质量电影级别视频的通用世界模型"

论文地址：https://arxiv.org/abs/2401.09985

项目主页：https://world-dreamer.github.io/

AIGC专区：https://heehel.com/category/aigc

WorldDreamer是一个基于Transformer的通用世界模型，能够完成多种视频生成任务，包括但不限于图像生成视频、文本生成视频、视频修改、视频风格化和基于动作合成视频等。该模型从20亿数据中学习物理世界，通过预测Token的方式建立通用场景世界模型，将视频生成转换为序列预测任务，从而对物理世界的变化和运动规律进行充分地学习。可视化实验证明，WorldDreamer已经深刻理解了通用世界的动态变化规律。

WorldDreamer无缝逐帧AI模型: 基于Transformer生成高质量电影级别视频的通用世界模型"

WorldDreamer的原理是将视频生成转换为一个序列预测任务，通过预测被掩码的视觉Token来生成视频。它采用Transformer架构，借鉴大型语言模型的成功经验，将世界模型建模框架转换为一个无监督的视觉Token预测问题。

WorldDreamer的特点是能够完成多种视频生成任务，包括但不限于图像生成视频、文本生成视频、视频修改、视频风格化和基于动作合成视频等。它具有生成高质量电影级别视频的能力，其生成的视频呈现出无缝的逐帧运动，类似于真实电影中流畅的摄像机运动。而且，这些视频严格遵循原始图像的约束，确保帧构图的显著一致性。

WorldDreamer的用途包括但不限于：