详情

首页手游攻略 UniWorld-View - 兔展智能联合北大等推出的开源世界模型

UniWorld-View - 兔展智能联合北大等推出的开源世界模型

佚名 2026-07-29 07:44:58

什么是UniWorld-View

由兔展智能联合北京大学、鹏城实验室推出的 UniWorld-View,是一款登顶李飞飞团队 WorldScore 世界模型评测榜单的开源世界模型。它能以单张图片或一段视频为基础,按照指定相机轨迹生成新视角画面,并通过统一架构实现单图 3D 生成和视频 4D 生成。目前模型已适配国产昇腾算力,代码及权重均已开源。

UniWorld-View具备哪些主要功能

  • 由单图合成新视角:推、拉、摇、移及 360° 环绕均受支持;只需输入单张图片,画面便会按照指定相机路径呈现多个视角。
  • 从动态视频合成新视角:新视角动态视频由输入的单目视频生成,未拍摄空间会被推断出来,时序一致性也能保持。
  • 统一式生成框架:静态图像和动态视频的新视角生成任务,可由同一套模型及代码共同支持。
  • 控制相机轨迹:通过精确控制相机位姿,完成大基线视角切换。

UniWorld-View采用的技术原理

  • 具备遮挡感知的点云渲染:为解决点云渲染中的前景背景撕裂和背面漏光,模型引入双重投影及法向过滤机制。
  • Double-Reprojection,即双重投影:源画面先被投影至目标视角,再按原路径回投;不能回返的像素会被判定为遮挡区域,并逐帧累积成遮挡 mask,从而防止错误纹理对生成模型造成误导。
  • Normal-Filtering,即法向过滤:借助法向信息过滤背面点云,避免相机移动到物体背后时出现正面像素穿透泄漏。
  • 融合几何与生成:相机控制精度与画面质量通过两阶段流程兼顾:目标视角条件图由几何模型构建 3D 点云后渲染,视频扩散模型再据此完成生成。

微信关注后回复“开源”,即可加入AI开源项目交流群

UniWorld-View如何使用

  • 准备环境:Python 环境及依赖安装配置前,先将 GitHub 仓库克隆下来。
  • 下载模型:开源权重可从两个来源下载,分别是 Hugging Face 与 GitHub Release。
  • 输入数据:将一张图片或一段视频准备为源素材,同时设定目标相机轨迹。
  • 执行推理:指定视角的新画面或视频会由模型自动生成,触发方式是执行推理脚本。
  • 部署至昇腾:国产算力场景需要推理加速与昇腾 NPU 适配,具体操作依照官方文档完成。

UniWorld-View项目地址

  • GitHub仓库:https://github.com/PKU-YuanGroup/UniWorld-View
  • HuggingFace模型库:https://huggingface.co/Drexubery/UniView

同类竞品和UniWorld-View对照分析

对比维度UniWorld-ViewWorldScape-0.2(MoE)WorldScore 总分静态 85.53、相机控制 97.72、3D 一致性 91.63 均居第一;对方仅动态 76.23 略高,其他维度则落后所用技术路线生成路线:视频扩散模型MoE 架构 + 遮挡感知点云渲染项目开源情况代码和权重全部开源,是否全部开源尚未明确国产算力支持已完成昇腾适配,另一方未提及任务统一能力前者以单模型兼顾视频 4D 和单图 3D,后者的重点是世界生成

UniWorld-View适用场景

  • 制作影视与广告:可迅速产出场景的多机位预览,减少实拍及三维重建成本。
  • 游戏与虚拟现实:可交互的 360° 环绕场景,能够从视频或单张概念图生成。
  • 自动驾驶与机器人仿真:视觉感知与路径规划模型的训练数据,来自对真实世界新视角的构建。
  • 数字化文化遗产:环绕视角的数字化展示,可在完成文物或古建筑的单图/单视频采集后生成。
  • 房地产与电商:用户沉浸感可借助多角度展示内容增强,这些内容由房间视频或单张商品图生成。
点击查看更多
推荐专题
热门阅读