我在谈论自回归世界模型的未来,如Google DeepMind的Genie 3,以及它们对游戏开发的潜在影响。
主题 1:神经帧生成和世界模型
Genie 3 已经能够在实时生成交互式世界,分辨率约为720p,帧率20-24 FPS。这很令人印象,但仍然远离传统游戏的分辨率、帧率和响应性。
这就是神经渲染和帧生成技术变得极其有趣的地方。
NVIDIA的当前DLSS堆栈已经使用AI生成额外的帧,DLSS 4.5可以在传统渲染帧之间生成多个帧。DLSS 5进一步利用AI来在实时重建照明和材料。
关键区别是,这并不意味着DLSS 5会使世界模型在120 FPS时运行起来。相反,神经渲染和帧生成可以将世界模型产生新状态的速度从显示这些状态的速度分开。
例如:
世界模型:24生成状态/秒
神经渲染/帧生成:潜在60-120显示帧/秒
这区别对于AI生成游戏来说可能变得极其重要。
GPU越来越成为一个AI推理设备,而不是仅仅是一个绘制机器。
而这会引发一个更大的问题:
当游戏引擎本身成为一个生成模型时会发生什么?
主题 2:潜在世界模型和长期记忆
另一个问题是时间一致性和记忆。
为什么当前的交互式世界模型倾向于依赖简单的动作空间,如W/A/S/D?
一个原因是控制一个生成的世界与控制一个传统游戏引擎根本不同。一个传统引擎维持一个明确的世界状态:对象位置、物理状态、材料、碰撞几何、NPC状态等。
一个生成的世界模型必须推断并维持一个有用的内部表示。
这就是潜在世界模型、JEPA风格架构和潜在状态空间模型变得极其有趣的地方。
而不是直接预测每个未来的像素,一个模型可以学习一个紧凑的表示世界状态的底层和预测该表示如何随时间变化。
换句话说:
像素空间 → 潜在/语义状态 → 未来状态预测 → 神经渲染
而不是:
像素空间 → 像素空间 → 像素空间 → ...
最近的研究,如ThinkJEPA,特别有趣,因为它结合了密集帧动态建模与更长时间的语义指导视觉语言模型。
更广泛的想法很重要:
如果这种方向继续扩大,我们可能会看到一个完全不同的游戏开发管线:
提示 → 世界模型 → 潜在模拟 → 神经渲染 → 交互游戏
在这种情况下,传统的游戏引擎可能不再是游戏世界的主要来源。
它可能成为一个生成世界模型周围的基础设施。
这就是我认为自回归世界模型、潜在世界模型、神经渲染、JEPA风格架构和AI驱动的GPU值得密切关注。
这不是另一个图形升级。
等待看看。
评论 (0)