我花了一整天试图用LingBot-World来模拟一个关卡生成器。输入提示,走来走去,看看会不会出现什么问题。这是游戏开发领域的现状。这是一种基于视频世界模型的游戏开发工具,与Genie 3和Oasis同属于一个家族,所以同样存在问题。从我的角度来看,驾驭它的过程是这样的:通过文字提示启动,然后根据WASD键和摄像机输入生成帧。输出是像素。没有其他信息。没有网格,没有深度缓冲区可以查询,没有场景图,没有几何体可以检查或导入。我尝试了最明显的管道。提示→帧→“只把它导入到three.js中”。没有什么可以导入。可以显示视频流,但不能导入场景。没有网格能够保持,因为根本就没有网格。我花了比我想象中更长的时间去寻找不存在的几何体。走来走去的视频片段看起来很精致,像幻想中的开放世界。但这不是引擎场景。这是基于输入生成的视频。摄像机能够推进是因为模型预测下一个帧应该是什么样子,而不是因为后面有任何空间上的协调性。持久性是另一个关键问题。世界在外观上保持一致,但在身份上则不一致。从石柱走开,绕回来,你会再次看到石柱,但不是同一个石柱。对于只有一次行走的模拟游戏来说,没问题。但是对于任何需要回访位置、任务标记或状态环境的设计来说,就会出现问题。所以实际的问题是:视频世界模型在游戏开发领域是否有用?你可以得到视觉效果,但零几何体。你可以探索,但没有什么可以碰撞。无限的多样性,当然可以。但是没有持久性,所以什么都不会积累。帧质量是无所谓的,重点不在那里。生成帧变得容易了。将它们转换为引擎可以实际使用的东西,这才是没有人解决的问题。有没有人找到一个实用的桥梁?不是通过输出的光流摄影,而是能够在循环中运行的东西。
单个提示可行走世界:你为什么无法将其导入你的引擎
评论 (0)