世界模型别只会续写像素:Puffin-World 把重力、深度和相机一起写进世界

🧠 大模型影像论文精读 · 2026-09-19 · World Model · 3D Generation · Novel View Synthesis · Camera Geometry
arXiv 2026-09 · 联合建模相机物理、场景几何与外观的三维世界模型
图片来源:Kang Liao 等, arXiv:2609.04196

Puffin-World 有意思的地方,不是又把视频生成得更像,而是把“续写像素”改成了“续写一个有上下、有远近、也有相机位置的世界”。

现在不少世界模型的基本做法,是给它一张图或几帧视频,让它猜镜头移动后会看到什么。画面短时间内可以很漂亮,但模型常把空间关系藏在内部特征里:镜头一旦大幅仰拍、翻滚或走得较远,地平线可能漂,房间结构可能变,生成出的多张图也未必能拼成同一个三维场景。原因很直白——“下一帧长什么样”与“相机在真实世界里朝哪、场景到底多深”不是一回事。

这篇工作的关键转折,是把世界拆成三种可检查的状态:外观就是 RGB 图像;几何用深度表示,也就是每个像素离相机多远;物理状态则记录重力方向和纬度角,告诉模型哪里是上、每条视线相对地平线有多高。作者又设计了 Omni-Camera(全向相机表征):它给每个像素附上相机射线、位置与朝向信息,把“绝对的上下”与“相邻视角怎样移动”装进同一个条件。这样,模型不只生成新视角,还同时预测深度,并把重力约束沿整段相机轨迹传下去。

它因此把原本分开的几件事接成了闭环:从单张照片判断相机姿态,按指定焦距和俯仰角换机位,生成一串新视角,再直接汇成三维点云。论文还训练了包含大量相机标注图像与运动轨迹的数据集。按作者报告,它在四个相机姿态基准上取得最优或接近最优结果;在新视角生成中,画质和相机控制也能同时维持。这里应理解为论文自报结果,并不等于所有复杂场景都已稳定重建。

放进真实影像工作流,这种思路很实用:手机相册可以从一张照片生成可轻微巡视的空间;虚拟制片能先指定镜头运动,再让画面服从机位;机器人和 AR 设备则可让“看懂场景”与“预演下一视角”共用状态。对修图而言,换构图、补边和重打光也有机会受深度与重力约束,不再只靠纹理猜测。

局限同样明显。它目前主要处理静态场景,所谓“物理”核心仍是重力与地平关系,不包含碰撞、材质或物体运动规律;深度和多视图也都是模型预测,长轨迹中一次小错仍可能逐步累积。Puffin-World 真正打开的是接口:世界模型终于开始把可见画面与可测的相机、几何状态放在一起,但离可靠的动态世界模拟器还有距离。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读