你好。我的名字是Max Salamonowicz。我是Omea背后的小工作室的创始人,尽管这篇文章是从我们的公司账户发出的,但我自己写的,名字下面,准备回答评论中的任何问题。快速背景,好让你知道我在说什么:我是波兰工程师。 我花了25年在跑笔记本RPG作为游戏主管。 我建造了机器人,嵌入式神经网络,手语翻译平台——现在,似乎是一个维京生存恐怖游戏,其中的故事是通过AI实时讲述的。 我写这篇文章是因为每当我们的游戏被提起时,几分钟内就会出现以下评论:“所以它是一个GPT包装器,具有奇幻外皮。” 这是一个合理的猜测。错误的猜测。 并且,为什么它是错误的,这我认为是真正有趣的——即使你从来不玩这个游戏。 # 什么是Omea Omea是一个交互式叙事RPG,其中的故事并没有事先写好。 没有分支脚本。 没有对话轮盘,三种选项隐藏两种结局。 一个叙述者AI在每个回合中运行叙事,出声讲述——游戏读出每个场景给你,你可以用你的声音回应,好像你坐在火堆旁边的叙述者旁边。 在我们的第一部故事中,你在一个冻结的北欧岛上洗涤。 想要和乌鸦做朋友而不是追逐它吗? 将剑埋在雪里并走开吗? 偷,骗,打,逃跑,背叛? 游戏不会抛出错误或推你回到路径上。 它倾身过来说:好吧,咱们看看会发生什么。 听起来像是你可以在下午推动任何前沿聊天机器人中的什么吗? 我们也是这样想的。 在2023年。 # 为什么你不能简单地包装一个模型 我们在我的合伙人问我“什么时候LLM会足够成为一个游戏主管?” 的那晚开始进行实验。 我的自信专家回答是“十年”。 我错了 timelines - 但我是正确的,标准模型无法做到这一点。 三个原因,所有三个都是拦路虎: 1. LLM无法维持一个故事。 请任何前沿模型为一个段落的虚构写出——好。 一页——好。 多个小时的连贯交互式叙事——每次都是脱轨的。 情节线会解散。 人物会忘记自己的性格。 一个故事不是一系列合理的下一个句子的序列;它是一个结构,有设置和回报,其中一个小时内的一个NPC的承诺必须在第四小时有意义。 下一个令牌预测总是向前看。 故事讲述需要在一处看向所有地方。 2. 用户/助手范式杀死了stakes。 标准LLM是作为ping-pong建造的:用户命令,助手服从。 这个架构会渗透到每种基于它的故事讲述尝试中——玩家变成一个神,下命令,AI变成一个奴隶,试图讨好。 但在一个真正的故事中,你不是一个具有管理员权限的用户。 你是故事中的一个演员,受到同样规则和后果的影响。 给玩家神级模式,没有stakes。 没有stakes,没故事。 3. 内存不是检索。 一次会话可以持续数小时——数百万个叙事状态令牌。 你不能将其dump到一个上下文窗口中并祈祷,RAG也行不通。 “玩家在第二章对商人很友好” 和 “商人的女儿在第七章面临危险” 在嵌入空间中是语义距离,但在叙事上是不可分割的。 故事内存是情绪的,时间的,原因的。 余弦相似度无法“同时,你之前的谎言即将有意义”。 时尚的2026年答案是“代理”!——一个规划者,一个角色,一个记忆,一个连续性,一个总调度员。 我们试图这样想。 结果是一台Rube Goldberg机器,消耗100个隐含令牌以显示一个可见令牌,并且响应缓慢。 交互式故事在多秒延迟中会死亡。 当你做出选择时,你需要感觉故事反应。 因此我们做了一个不合理的事情。 # 我们训练了自己的模型。 它开头很糟糕,后来它成功了。 我们的第一轮迭代——GPT-2时代的实验,交叉与LSTMs和我们自己的设计的变异架构,训练在一个精心手动注释的数据集上,后来增长到155,000部小说和剧本。 我们失败了。 第二轮迭代产生了我只会在3点的午夜时分展示给合伙人时的输出——当每个人都睡眠不足足以在垃圾中看到潜力时。 但垃圾做了标准架构做不到的事情:它在长序列中维持叙事意识。 粗糙,糟糕——但它在试图讲述一个故事而不是预测单词。 这足以让我卖掉我的车来支付下一个月的计算资源。 不是比喻。 自助式AI研究不是罗曼蒂克的冒险起点Twitter宣传的那样。 今天这一系谱是NIA——叙事智能架构——一个大型混合专家模型(350B+参数),它不是优化基准或编码。 它是优化的情绪智慧。叙事结构。知道你在故事弧中的哪个地方以及故事需要什么现在。 由于大多数人在智力指数上竞争,我们押注蓝海是情商。 然后我们必须为它服务。 如果你想要完整的推断恐怖故事,我在别处写了它,但亮点是:我们的vLLM基线给了我们16秒到第一个令牌。 无法玩。 到165 tok/s每个用户并且3.5s的时间来到意味着我们需要一个实验性的SGLang分叉,EAGLE推测解码,融合MoE内核和固定依赖版本版本到精确的补丁发布——一个transformers版本会崩溃tokenizer,下一个会默默地将我们的推测接受率从0.82降低到0.25没有错误消息。 我们还发现FP8 KV缓存——在Hopper上更快——在Blackwell上是~19% 更慢,因为B200的内存子系统将瓶颈转移到计算和量化/量化内核变成纯粹的开销。 没有人告诉你这些事情。 你在2点的深夜,在发布日,才能发现它们。 这不是“包装一个模型”。 这就是点。 # 现在最令人惊讶的事情是我们公司里有更多的故事家数编程人员。 不是作为宣传语句——作为组织图谱的事实。 我们的作家和设计师比工程师多,因为AI不会创造我们的世界。 我们的作家和设计师创建设置,神话,NPC及其动机和矛盾,发生在那里事件的总体形状。 他们为你建造一个世界。 AI是表演者——即即兴演员谁从来不会打破角色,谁从来不会在2点的深夜疲倦——并你是另一个演员,有一个真正的声音和真实的选择推动故事到某个地方没有人编写。 这是从笔记本桌上演出的精确分工。 战争模块是由人类编写的。 会话是即兴的。 玩家拥有自己的选择。 我们只是教了机器坐在GM椅子上——在人有品味建造的世界里。 我一直回到一个比较。 当相机被发明时,它没有抢走读者的书。 它添加了电影到人类可以体验的书架。 我们这样看待这个技术。 在人类历史的大部分时间中,故事都是即兴讲述的——有人在听众的脸上观察并根据他们的变化改变故事。 书籍和电影是非凡的,但它们冻结了叙述者。 这个技术解冻了它们。 它不替代小说家或电影编剧或游戏编剧。 它添加了一个新的座位。 我不是来赢得关于AI的争论的。 我知道这个社区对生成的废话的感觉。 我们的确诚实地说:我们如何在自己身上做到这一点:游戏告诉你明确地讲述的叙述是由AI生成的,叙述者在警戒线内工作,世界,艺术指导和音乐都是人类决策。 这够了吗? 是你的决定,而不是我的决定。 # 尝试打破它 试玩是免费的,地址是omea.ai。 一部故事,没有等待名单,没有电子邮件门槛。 来玩,做出作者们从未预料到的东西,告诉我什么会让人不爽——我们明天就会修复它。 这就是交易。 烏鸑鸒等着你。 它会喜欢听你的版本。 少说,多做。 Max Salamonowicz Omea创始人 PS. 是的,3D骰子是真正的物理学——数千次模拟投掷,记录,游戏重新播放一次掷出所需的数字的掷骰子。 每个好的地下城主都在屏幕后面掷骰子。 我们只是用刚体动力学做到了。
我们AI游戏工作室里有更多的故事讲述者,而不是程序员。以下是原因——以及我们实际上花了多少时间和精力来打造一个没有剧本的游戏。
评论 (0)