世界模型的四类范式与 LeWorldModel

2026.05.26

世界模型的四类范式与 LeWorldModel

1. 任务简介

本次汇报介绍世界模型的基本目标,即根据过去与当前观测形成环境表征并预测未来变化。报告从潜空间推理、像素生成、几何结构和物理仿真四个视角梳理代表性工作,并重点解读端到端联合嵌入预测方法 LeWorldModel。

2. 研究动机

语言模型擅长符号与语言推理,却难以直接理解物理因果关系和行动对环境的影响。机器人、自动驾驶、强化学习与交互式生成任务需要可预测、可规划的环境模型。不同建模空间在表达能力、物理一致性、可解释性和计算成本之间存在显著权衡。

3. 方法设计

报告将世界模型概括为四类范式:潜空间方法以 World Models、DreamerV3 和 JEPA 为代表,在压缩表示中预测状态;生成范式以 Sora、Genie 为例,直接在视频或像素空间生成未来观测;几何范式使用占用空间或鸟瞰图表达三维结构;仿真范式借助物理引擎显式模拟动力学。

LeWorldModel 面向 JEPA 中的表示崩溃问题,引入 SIGReg,使潜变量分布接近标准高斯。模型由视觉编码器和动作条件预测器构成,仅以预测损失和正则项训练,在潜空间中用模型预测控制优化动作序列。

4. 实施细节

实验覆盖 PushT、TwoRoom、Reacher 和 OGBench-Cube 等环境,并与 DINO-WM、PLDM 及目标条件离线强化学习方法比较。测试阶段采用交叉熵方法搜索候选动作序列,结合滚动时域控制持续重新规划。除任务成功率外,报告还通过物理量探针、潜空间可视化和违反期望测试考察表示是否保留物理结构。

5. 实验与结论

LeWorldModel 在 PushT 等任务上取得较强性能,且较高维预训练特征方法具有更快的规划速度;在复杂三维环境中,预训练视觉特征仍可能更具优势。SIGReg 降低了损失设计和超参数搜索的复杂度,并改善了训练稳定性。其不足包括规划时域较短、依赖覆盖充分的动作数据,以及在低内在维度或复杂三维场景中可能受到正则化与表征能力的限制。

本次组会演示文稿下载