北京大学研究团队打造的"迷你世界"
在人工智能内容学习中,北京大学研究团队打造的"迷你世界":让AI从零学会预测未来,普通显卡也能训练视频世界模型是常见主题。很多人在阅读时会遇到概念分散、步骤不清和注意点难以归纳的问题。本文按照基础概念、操作流程和关键细节,对相关内容进行整理。
这项由北京大学领导的研究成果以预印本形式发布于arXiv,编号为arXiv:2608.01127,发布时间为2026年8月4日。研究团队开源了完整的代码、训练好的模型权重以及所有实现细节,希望将这项技术的门槛降低到普通研究者都能参与的水平。

当你玩电子游戏时,游戏引擎会根据你按下的每一个按键,实时计算出下一帧画面应该是什么样子。角色走到墙边会被挡住,扔出去的物体会按照物理规律飞行,光线会随着时间变化而改变。这种"根据当前状态和你的操作预测接下来会发生什么"的能力,正是所谓视频世界模型的核心。北京大学的研究团队把这个问题搬到了AI领域,并且想办法让这件事变得人人可做——这就是MiniWorld(迷你世界)项目的由来。
一、当AI需要学会"看见未来"
要理解视频世界模型到底是什么,可以用一个很直观的场景来说明。假设你是一个机器人管家,你的主人给了你一张厨房的照片,再告诉你"向前走两步,再向左转"。一个普通的视频生成AI可以生成一段看起来流畅漂亮的厨房视频,但它不一定真的理解"向左转之后,原本在你右边的冰箱应该出现在你左边"这件事。而视频世界模型要做的,恰恰是这种对空间、物理规律和动作结果的真实理解。
普通视频生成模型关注的是画面好不好看、动作流不流畅,而视频世界模型关注的是世界规律是不是对的。这个区别就像画一幅漂亮的风景画和真正理解地理地貌之间的差距。前者只要视觉效果好就行,后者要求你真正懂得山是怎么形成的、河流为什么这样流淌。
近年来,谷歌DeepMind的Genie 3、英伟达的Cosmos、以及国内多家机构推出的Matrix-Game、MAGI-1、SkyReels-V2等系统,都展示了大规模视频世界模型的惊人潜力。这些系统可以用于机器人训练、自动驾驶仿真、交互式游戏场景生成等领域,前景十分广阔。
然而,这些系统有一个共同的问题:它们太贵了。大多数方法的思路是拿一个已经预训练好的大型视频生成模型,再通过各种复杂的后期调整把它改造成具有世界模型能力的系统。这个过程不仅需要强大的计算资源,还面临一个根本性的矛盾——这些预训练模型在学习时是"双向看"的,也就是说它们在处理一段视频时可以同时看到过去和未来的帧;但实际使用时,世界模型需要"单向流",只能看到过去,再预测未来。这种训练和使用之间的不一致,就像一个学生平时做题时可以翻答案,考试时却不能翻,结果考出来的成绩自然打折扣。
北京大学的团队决定走一条不同的路:从零开始训练,完全按照"只看过去、预测未来"的方式设计整个系统,让训练和使用完全一致,同时把计算成本压缩到一台配有八块GPU的服务器就能在几天内完成训练。
二、像搭积木一样构建AI的时间感知
MiniWorld的核心架构可以用"积木式时间隧道"来理解。把一段视频想象成一列火车,每节车厢是若干帧画面的组合,叫做"块"(chunk)。MiniWorld处理视频的方式是:在同一节车厢内,所有帧可以互相参考、双向交流;但跨越车厢时,信息只能从前面的车厢流向后面的车厢,不能反向。这就叫做"块状因果注意力"。
这种设计非常聪明。在一小段时间内,画面的各个部分确实可以互相影响——比如一个挥动的手臂,手腕和手指的运动是紧密关联的,让它们相互参考能产生更自然的效果。但对跨越较长时间的预测,必须保持严格的单向流动,这样才能在真实使用时像流水一样不断向前生成,而不需要等所有未来帧都准备好才能开始。
支撑整个系统的数学基础叫做"整流流"(Rectified Flow),这是一种生成AI常用的技术,属于更广泛的"流匹配"(Flow Matching)框架。用一个简单的类比来说明:你有一罐纯净的沙子(代表目标视频帧),也有一罐被搅乱的沙子(代表随机噪声)。整流流要做的,就是学会一条从乱沙到净沙的最直最短的路径。在生成图像时,从一罐乱沙出发,沿着这条路径走,就能得到干净的视频帧。所有的训练和推理都在一个预先训练好的视频VAE(可以理解为一种视频压缩编解码器)的"潜在空间"中进行,这样可以大大减少计算量,因为你操作的是压缩后的紧凑表示,而不是原始的高分辨率像素。
动作信息是这个系统里另一个关键角色。对机器人操作任务,每一帧视频都对应一个7维的动作向量,描述机械臂末端在三维空间中如何移动以及夹爪的状态。对相机移动任务,则是用数学方式描述相机的位置和朝向。MiniWorld将这些动作信息通过一个专门设计的"动作编码器"转化为两种信号:一种是"语义嵌入",告诉模型"现在发生了什么样的动作";另一种是"调制向量",直接微调模型内部每一层的计算方式。这种"双轨并行"的设计,使得动作条件能够既从全局层面、又从每个细节层面影响生成结果,比简单地把动作信息塞进输入层要有效得多。
为了让这种影响在不同层之间既灵活又高效,研究团队还引入了一种叫做"AdaLN-LoRA"的技术。通俗来说,模型的所有层共用一套基础的调制逻辑,但每一层可以在此基础上学习一个轻量级的个性化微调。打个比方,这就像一家连锁餐厅:总部提供统一的基础配方,每家门店可以根据当地口味做少量调整,但不需要每家门店都从头研发一套完整的配方体系。这样既保证了一致性,又保留了灵活性,而且额外的参数开销非常小。
三、给时间加上"越往后越模糊"的噪声规则
MiniWorld在训练方式上借鉴了一种叫做"扩散强制"(Diffusion Forcing)的思路,并在此基础上做了重要改进。理解这个部分,需要先明白一个问题:在训练时,模型同时看到一段视频的多个块,每个块被加了不同程度的噪声。但噪声怎么分配,大有讲究。
研究团队制定了一条核心规则:沿着时间方向,噪声只能越来越多,不能越来越少。用数学符号表示就是τ? ≤ τ? ≤ ... ≤ τ?,其中τ=0表示完全干净的数据,τ=1表示完全是随机噪声。这条"单调递增"的约束,直接反映了现实世界的认知规律:过去发生的事情已经确定,未来发生的事情越来越不确定。已经生成的视频块是"干净"的,还没生成的块处于"充满可能性的模糊状态"。
这条规则带来了两个好处。第一,它大大缩小了模型需要应对的"噪声组合方式"的数量,让训练更稳定、收敛更快。第二,它让训练时的状态和实际推理时的状态更加吻合,减少了"练习时和考试时状态不一样"的问题。
为了让噪声分配更加科学,研究团队设计了一种叫做"面向块的概率传播调度器"(CoPP,Chunk-oriented Probability Propagation)的方法。它的工作方式是:先随机选一个"锚定块",从一个特定的概率分布中给它分配一个噪声级别;再向两侧扩展,保证整体满足单调递增的约束,同时让每个块的噪声级别都有机会覆盖从低到高的整个范围。这样,模型既能看到"从接近干净到接近纯噪声"的各种状态转变,又不会让某些噪声组合被过度采样而另一些被忽视。
另外,MiniWorld还支持两种上下文模式的混合训练。一种是"图像转视频"模式:只有第一帧是干净的,第一个块里其余的帧都被加了噪声,相当于给模型一张起始图片,让它生成后续视频。另一种是"视频转视频"模式:第一个完整的块都是干净的,相当于给模型一小段起始视频,让它继续生成后续内容。训练时随机混合这两种模式,使得同一个模型在推理时不需要任何改动就能支持这两种生成场景。
四、分两阶段"打怪升级"的训练策略
即便有了上面这些设计,如何高效地训练出能处理长视频的模型,仍然是一个工程难题。MiniWorld采用了一种两阶段的训练策略,可以用"先练短跑、再练马拉松"来形容。
第一阶段,模型在21帧和46帧的短视频片段上训练,使用较大的批次大小(64)和较高的学习率(1×10??),让模型快速而高效地学会局部的动作-状态转换关系。短视频计算量小,可以用更多样本覆盖更广泛的场景,让模型打好基础。
第二阶段,模型在125帧直至253帧的长序列上继续训练,批次大小缩小到8,学习率从0缓慢预热到2×10??。这个阶段不改变训练目标,只是把视频拉长,让模型见识到更长的因果链条:一个动作在很久之后会造成什么影响,过去的历史信息如何跨越更长的时间发挥作用。
第二阶段还引入了一个叫做"时间步偏移"的技巧:对噪声级别的采样分布做一个非线性变换τ = sτ/(1+(s-1)τ),其中s是一个根据视频序列长度自动确定的参数。这个变换会重新分配噪声级别的采样密度,让模型在面对更长序列时,能更多地关注那些对大规模模型特别重要的中等噪声级别,进而提升优化效果。这项技术在Stability AI的SD3等大型图像生成模型中被验证有效,MiniWorld将其迁移到了长视频生成场景。
模型规模方面,MiniWorld提供了从0.12B(1.2亿参数)到3B(30亿参数)的五个版本,分别是MiniWorld-B、MiniWorld-L、MiniWorld-0.5B、MiniWorld-1B和MiniWorld-3B。它们共用完全相同的架构设计和训练接口,只在层数、隐藏维度和注意力头数量上有所差异。主要实验结果使用MiniWorld-1B(28层,隐藏维度1536,12个注意力头,共约10亿参数)完成。
五、让AI像流水一样持续生成视频
训练完成之后,如何在实际使用时高效地生成长达数百帧的视频,是另一个关键挑战。MiniWorld的推理系统可以用"流水线工厂"来理解。
工厂的核心思路是:把已经生成好的视频块"锁定",放入一个"滚动KV缓存"中永久保留其关键信息;同时,工厂的生产车间(活跃去噪窗口)只处理最近的若干个正在生成中的块。随着生产不断向前推进,新的块进入车间,完成的块退出车间并存入缓存,车间的大小始终保持不变,计算量也所以保持稳定,无论最终要生成多长的视频。
这套机制的重要组成部分之一是"流水线式异步去噪"。在同一个时刻,活跃窗口内可以有多个处于不同噪声级别的块同时被处理:最靠近历史的块已经几乎干净,最靠近未来的块还充满噪声。它们各自以不同的步伐向"干净"的方向前进,就像流水线上不同工序同时运作,而不是一个工序全部完成才开始下一个。这样做的好处是吞吐量大幅提升,第一个生成块的延迟也显著降低。
另一个精妙的设计是"RoPE重新偏移"。模型内部用一种叫做旋转位置编码(RoPE)的技术来感知时间位置,就像给每一帧视频打上时间戳。随着视频不断向前生成,时间戳的数字会越来越大,超过模型在训练时见过的范围,就可能出现"从未见过这个时间戳"的问题。MiniWorld的解决方案是:每当缓存里最老的块被丢弃,就把所有保留下来的历史块的时间戳整体向前挪,让滑动窗口重新从"第0帧"开始计数。由于RoPE只影响键(Key)不影响值(Value),只需更新键的编码即可,操作高效且不破坏块之间的相对时间关系。初始的那一帧"锚点"则永远固定在第0位,不参与这个重新编号的过程。
六、在机器人和室内场景两个舞台上的表现
研究团队在两个真实世界的数据集上测试了MiniWorld的能力,这两个数据集分别代表了截然不同的"世界规则"。
第一个是DROID数据集,里面记录了大量机器人在真实环境中操作物体的视频,每一帧都对应机械臂的7维动作向量。这是典型的"给我看动作,预测会发生什么"的场景,考验模型对物理交互的理解。视频被缩放到240×320像素,编码后的潜在表示使用Wan2.2 VAE,该VAE在时间维度压缩4倍、空间维度压缩16倍,并使用48个潜在通道。
第二个是RealEstate10K数据集,里面是大量室内场景的视频,每一帧都标注了精确的相机位置和朝向。这个数据集没有机器人,没有物体交互,考验的是模型对相机运动的理解和三维空间一致性。相机参数通过按照NeRF约定转换成每像素的射线方向,再用15个正弦频率带编码,每帧产生180通道的空间条件信息,四帧合并后得到与每个潜在帧对齐的720通道条件。
评测的基准是一个"双向短视频基线":用一个传统的双向视频生成模型,在固定长度的29帧滑动窗口内做预测,每次预测完就向后滑动。这代表了当前最主流的、改造预训练模型的做法。评测指标覆盖了画面外观质量、动态程度、几何一致性、VLM语言模型打分的功能性质量以及帧级保真度等多个维度,每个大类下面还有多个细分指标。所有结果以基线为1进行归一化,误差类指标取倒数使得"越大越好"的判断方向统一。
在DROID上,MiniWorld-1B进行253帧流式推理的结果令人印象深刻。轨迹准确性(衡量机械臂运动是否符合输入动作)提升了249%,深度准确性(衡量三维几何重建的准确性)提升了238%,LPIPS感知相似度指标(数值越低越好,这里取倒数显示)提升了216%,SSIM结构相似度提升了125%。外观类指标提升了26%到82%,VLM语言模型评判分数提升了63%到78%。这些数字背后的含义是:MiniWorld不只是让每一帧看起来更好看,而是真正理解了机器人的动作会带来什么样的几何变化,保持了更长时间的时空一致性。
在RealEstate10K上,提升幅度相对温和,但同样覆盖多个维度:光度平滑性提升89%,深度准确性提升55%,主体一致性提升50%,背景一致性提升46%,透视性提升46%,PSNR峰值信噪比提升34%,SSIM提升19%,LPIPS提升27%。这说明同一套流式架构,从有物理交互的机器人操控场景,迁移到纯相机运动的室内场景,都能带来稳定可靠的提升,而不是只在某个特定数据集上有效。
七、通过一系列对照实验验证设计选择
研究团队对推理阶段的多个关键参数进行了系统性的消融实验,即"其他条件不变、只改一个因素"的对照测试,逐一验证每个设计选择的必要性。
关于分类器自由引导(CFG)的作用:开启CFG后,平均指标提升约5.5%,外观类提升9.9%,动态类提升11.8%,而帧级保真度几乎不变。这说明CFG主要作用是提升视觉质量的"精致感",对精确还原具体帧内容的影响有限。它像是一个画面质感的旋钮,可以根据需求灵活调整。
关于生成视频长度的影响:把生成视频从253帧延长到381帧,外观类和动态类指标分别保持在94%和96%,说明模型基本保持了稳定;但几何、VLM质量和帧级保真度指标下降更明显。这表明随着生成时间的拉长,累积误差在几何精度和整体感知质量方面的影响要大于对画面外观和运动流畅性的影响。
关于在线去噪窗口大小的影响:把活跃窗口从32块缩减到8块并搭配滚动KV缓存,各类指标几乎没有变化——外观略有提升,动态稳定,几何、VLM和保真度在完整窗口的几个百分点以内波动。这个结果证明了滚动KV缓存的核心价值:只要把已完成的块正确缓存起来,小窗口可以达到大窗口的效果,同时计算量大幅降低。
关于KV缓存大小的影响:在固定64帧推理长度、8个活跃块和1个锚点帧的条件下,把缓存从24块减到12块几乎看不出差别,减到6块也只有个位数百分比的变化。外观和动态类指标始终在24块参考值的1%以内。这说明在这个推理长度下,模型并不需要保留很长的历史来维持质量,只需要足够的近期上下文即可。
关于锚点帧数量的影响:在24块KV缓存的条件下,从0个锚点变为1个或2个锚点,外观和动态指标略有下降,VLM质量和语义一致性类指标略有提升,轨迹准确性则随锚点增多略有下降。综合来看,锚点的作用更接近"全局语境的稳定器",而不是提升质量的主要来源。真正带来显著提升的,是滚动KV缓存流式推理机制本身。
在扩展性方面,研究团队在RealEstate10K上对比了0.5B、1B和3B三个规模的模型,所有指标随模型规模单调递增。到了3B规模,相比0.5B,动态程度提升22%、深度准确性提升18%、图像质量提升14%、光流分数提升12%。动态和几何方面的提升幅度大于外观,说明扩大模型规模主要强化的是运动建模和三维一致性能力。
在推理效率方面,测试结果非常直观。使用32块完整窗口推理时,整体输出帧率为3.31帧/秒,第一块的生成延迟高达74秒;切换到8块活跃窗口加滚动KV缓存后,输出帧率提升到7.29帧/秒(提升2.20倍),第一块延迟降至4.86秒(降低15.2倍)。这个提升完全来自DiT计算量的减少:DiT吞吐从0.41块/秒提升到0.91块/秒,而VAE吞吐在两种设置下都维持在约15.2块/秒。换句话说,VAE编解码从来不是瓶颈,DiT的注意力计算才是,而滚动KV缓存正好解决了这个问题。
归根结底,MiniWorld想说明的是:做一个能稳定运行、训练和推理自洽、计算代价合理的视频世界模型,并不一定需要顶级机构才有的超算集群和私有数据集。一套清晰的设计思路加上严格的工程实现,就可以在学术预算内实现有竞争力的结果。这个框架不是要取代那些大规模商业系统,而是想成为研究者们可以方便使用、自由改造的实验平台,让更多人可以研究那些真正有趣的科学问题:AI怎样建立长期记忆?如何减少越来越长的生成序列中误差的积累?怎样让训练目标和推理过程更紧密地对齐?当这些问题不再被巨大的计算门槛挡在门外,研究的进展或许会快很多。研究团队已将完整代码、模型权重和实现细节全部开源,感兴趣的读者可以通过arXiv编号2608.01127找到这篇论文,进一步探索这个方向。
Q&A
Q1:MiniWorld视频世界模型和普通视频生成模型有什么区别?
A:普通视频生成模型主要关注画面是否好看、动作是否流畅,但不真正理解物理规律和动作后果。MiniWorld这类视频世界模型则需要真正理解"向左转之后冰箱会从右边移到左边"这样的空间逻辑,能根据机器人动作或相机移动预测出符合真实物理规律的未来画面,主要用于机器人训练、自动驾驶仿真等需要理解世界动态的场景。
Q2:MiniWorld训练需要多少算力?
A:MiniWorld的一个核心目标就是降低计算门槛。根据论文介绍,完整的MiniWorld模型(包括0.5B到1B参数规模)可以在一台配备8块GPU的单机服务器上,在数天内完成从零开始的全流程训练。这与那些需要数百乃至数千块GPU的大型商业世界模型系统相比,成本差距极大,普通高校或中小研究团队具备可行性。
Q3:MiniWorld的滚动KV缓存是怎么让长视频生成变快的?
A:传统方法生成长视频时,每生成一个新的片段都需要重新处理所有历史帧,计算量随视频长度线性增长。MiniWorld的滚动KV缓存把已完成的视频块的关键信息存储起来,新块只需参考缓存中的摘要信息,不需要重新计算历史。活跃处理窗口的大小固定不变,无论视频多长,计算量都保持稳定。实测显示,这使输出帧率从3.31提升到7.29帧/秒,第一块生成延迟从74秒降至4.86秒。
-
09.04
如何通过Office技巧提升工作效率怎么做-步骤任务条件
-
09.04
Alcohol提示词怎么写-画面元素和风格参数
-
09.04
掌握Excel表格实用用法-主要信息和内容重点
-
09.04
智谱清言聊天记录突然消失怎么办
-
09.04
掌握eksr表格实用用法,轻松提升数据处理效率讲了什么-主要信息
-
09.04
掌握Excel实用用法-主要信息和内容重点
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏