我已经深入到交互式AI视频/世界模型空间了好久了,但一直有一个问题困扰着我,所以我想打开它。每隔几周,世界模型演示就会疯狂流行。可玩的生成世界、无限的Minecraft、可在实时控制的视频模型。整个时间线都疯狂了48小时,然后什么都没有。没有产品、工具或游戏。只是下一个演示。这种循环已经持续很长时间了,我想了解为什么。我的理论是,有两个独立的问题,大家都混淆了。第一个是模型本身,实话说,模型本身已经基本工作了。输出已经足够好,能够在上面建立。现在这不是阻塞点了。第二个是围绕模型的所有东西,这就是我个人上周花了很多时间的地方。要让一个可交互的模型在线运行,你必须调度GPU工作者,建立实时流媒体层,让用户能够看到和控制它,分发短期凭证,处理用户掉线和重新连接而不丢失会话状态,计量所有这些。如果你想收费,必须做到这一点。这些并不是AI问题。它们只是令人厌倦的、不可见的基础设施,从来没有出现在疯狂的演示中。所以,我真的怀疑原因不是模型本身,而是“酷演示”和“陌生人可以使用的东西”之间的巨大和不引人注目的差距,大多数人都在这个差距上放弃了。但是,实际上我不知道的事情是,即使基础设施解决了,即使是单个API调用,我也不确定人们会做什么。所以,我想听听你们的意见。一些我正在思考的方向包括:使用真正生成的、可探索的世界而不是预先编写的关卡的游戏。实时AI视频工具,你可以直接控制它,就像导演的椅子一样,而不是当前的渲染和祈祷的批处理工作流。用于训练或测试其他代理和机器人针对罕见边缘案例的模拟器。虚拟生产背景,反应于真实的摄像机而不是预渲染的LED墙。但是我有一个困扰我的担忧,这整个类别可能是解决了问题的解决方案。诚实地告诉我,如果你认为这是真的。所以,两个诚实的问题:如果基础设施是单个API调用,你会在可控制的世界模型上构建什么?并且,你会立即开始构建什么,还是这个领域还不适合真正的使用?不是推销任何东西,不是链接,只是想了解这个类别是否有真正的理由存在,还是我们都只是享受着漂亮的演示。