World Labs推出全球首个多模态世界模型Atlas,像素级镜头控制拍出电影级“子弹时间”大片

在人工智能领域备受瞩目的“AI教母”李飞飞创办的World Labs,于近日正式发布了全球首个多模态世界模型——Atlas。该模型 最大 的突破在于,能够以像素级的精确相机控制来生成图像和视频帧,并将其在三维空间中进行完美重建。 作为一款从头开始进行预训练的全新模型,Atlas能够无缝接受包括相机移动在内的多模态输入,并将其转化为立体的三维视图。通过在模型的
在人工智能领域备受瞩目的“AI教母”李飞飞创办的World Labs,于近日正式发布了全球首个多模态世界模型——Atlas。该模型 最大 的突破在于,能够以像素级的精确相机控制来生成图像和视频帧,并将其在三维空间中进行完美重建。
作为一款从头开始进行预训练的全新模型,Atlas能够无缝接受包括相机移动在内的多模态输入,并将其转化为立体的三维视图。通过在模型的空间上下文中精准定位多个输入视图,用户可以生成具备 绝对 控制力的图像和视频帧,从而轻松实现宛如好莱坞大片般的“子弹时间”拍摄效果。此外,它还能从单张或多张输入图像中输出明确的3D模型,在重建效果上超越了目前许多 顶级 的开源重建模型。
在具体的工作机制上,Atlas会根据用户指定的任意摄像机位置和角度,生成一个或多个与原始内容及几何形状完美匹配的参考图像,平滑地扩展画面,并自主想象和填补输入中看不见的场景细节。
官方介绍显示,Atlas能够全面胜任世界生成、重建和模拟等广泛任务。首先在相机控制生成方面,它能够通过像素精确的相机控制,从一张或多张图像中输出最长达1分钟的1440p高清视频。其次在空间重建方面,它不仅能从数十张输入图像中重建真实场景,还能从新颖视角生成图像帧以及显式三维输出。此外,该模型还支持时空模拟功能,通过输入视频来建模空间与时间,重新构图视频以增强戏剧性视觉效果,并为机器人的真实到模拟工作流程提供支持。同时,它也完全支持从文本生成图像和360度全景,能够精准跟随复杂的提示词、渲染文字并呈现各种多变的的视觉风格。
目前,World Labs官方表示已经有部分合作伙伴获得了该模型的抢先体验资格,并计划在未来几周内逐步向更广泛的早期访问者开放。
要点速读
在人工智能领域备受瞩目的“AI教母”李飞飞创办的World Labs,于近日正式发布了全球首个多模态世界模型——Atla
- 在人工智能领域备受瞩目的“AI教母”李飞飞创办的World Labs,于近日正式发布了全球首个多模态世界模型——Atla
- 更多细节仍在持续更新中
- 更多细节仍在持续更新中