大晓机器人、南洋理工大学发布统一多模态世界模型Puffin-World

大晓机器人、南洋理工大学发布统一多模态世界模型Puffin-World

  新京报贝壳财经讯(记者罗亦丹)记者9月10日获悉 ,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World 。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理 、几何和外观定义为三种原生的三维世界状态 ,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。

大晓机器人	、南洋理工大学发布统一多模态世界模型Puffin-World-第1张图片

  针对机器人训练来说,需要的并不是一段视觉上逼真的视频 ,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态 ,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分 ,物理方向 、空间几何和视觉外观共同构成机器人真正需要的训练环境 。

  Puffin-World可以在一个模型中统一四类过去往往需要不同系统分别完成的任务,包括:

  单图理解相机物理信息。输入一张图片,模型能够结合地平线 、垂直结构和场景构图进行空间推理 ,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,同时生成场景语义描述。模型不仅识别“图中有什么”,还理解“当前视角以怎样的姿态看到了它 ” 。

  自由视点空间仿真 。除文字描述外 ,用户还可以明确指定相机方向和视场角。模型据此生成符合目标机位的画面,使文生图从内容控制进一步走向精确的空间控制。

  三维世界生成与重建 。模型可以从文字、单张图像或少量借鉴 图像出发,按照指定相机轨迹生成多个新视角 ,并同步预测每个视角的外观和深度。不同视角随后可以汇聚为具有一致空间结构的三维世界。

  闭环自校准探索 。当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作 ,并生成动作执行后的目标观察 ,由此形成“状态感知—动作预测—结果生成—再次校准”的闭环。

  Puffin-World同步开源代码 、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注 ,为机器人仿真、合成数据生产与具身智能训练提供可复现 、可扩展的技术底座。

(文章来源:新京报)

©版权声明
THE END