研究人员对53款游戏和公开原型进行了调查,结果发现几乎一半是叙事冒险游戏,仅有四款是模拟游戏,两款是关系或伴侣游戏。

该研究认为,一款游戏只有在生成式AI是其核心循环的关键部分时才算是“AI原生”的。研究人员筛选了98个候选者,保留了53个,然后根据玩家面向的形式和AI在游戏中的作用进行分类。

53个游戏中,24个是叙事冒险游戏,8个是角色扮演游戏,7个是谜题。三种类型的游戏加起来占样本的近75%。

结果对生成式AI在游戏中的应用做出了一个限制。目前的例子更有可能使用语言进行询问、说服或故事的继续,而不是运行一个持久的世界,充满了自治的人物。

**游戏必须改变游戏的方式**

该论文使用了三个测试。生成式AI必须在游戏中运行,核心循环必须依赖于其输出,且有限的真实内容或确定性的规则不能替换它而不改变游戏的本质。

这样排除了几个常常被描述为AI游戏的东西。游戏不变成AI原生的游戏,因为开发者使用模型制作了概念艺术、对话或代码。可选的会话角色不够,因为主游戏仍然可以正常工作。传统的路径寻找、行为树和程序生成也无法满足论文的定义。

这个区别对玩家来说是有用的,因为它将AI的披露与AI的机制区分开来。前者描述了一个游戏或其资产是如何制作的。后者描述了一个玩家可以做什么,玩家不这样做游戏就不会有相同的效果。

研究人员将探险游戏“瓦德维尔”归为“知识性互动”类别:玩家需要从AI角色那里获取信息,并且必须提问才能前进。其Steam页面描述了与角色进行的实时生成的对话。

共同作者徐志岳说,一个AI风格的狼人社交推理游戏是最难以区分的边缘案例。团队最初将其视为AI原生的,因为语言模型可以说话、推理、欺骗和投票,但最终将其视为AI增强的。

“狼人仍然可以正常工作,如果LLM玩家被替换为人类,脚本化的机器人或传统的AI。”徐志岳对Gaming Intelligence说。分类将改变,如果移除模型消除了玩家行动的中心形式或导致核心循环崩溃。

无限手艺是一个不同的案例。其官方应用程序列表描述了一个循环,在循环中,玩家组合元素以发现新的元素。该论文将其归类为语义裁决,而不是简单的内容生成,因为AI决定并稳定组合的结果。生成的答案成为玩家可以学习的规则的一部分。

**大多数当前的机制以语言为基础**

该论文的第二个分类看的是AI在循环中的作用。17款游戏使用它进行调查或其他信息寻求的互动。14款游戏使用它继续故事或作为游戏主持人,11款游戏将说服、欺骗或谈判作为主要机制。

这三个语言重的群体占了53个例子的42个。语义裁决出现了六次,多智能体模拟四次,生成构建一次。

语言是一个方便的适合,因为模糊性可以成为游戏的一部分。一个嫌疑人可以给出回避回答而不立即打破侦探故事。一个生成的剧情转折可以被视为惊喜。一个谜题可以问模型是否一个开放的答案满足一个约束。

徐志岳说,这个集中度反映了语言模型的成熟度和找到例子的方式。对话、调查、故事的继续和说服是开发者更容易构建的,但也更容易描述和搜索的。

“因为我们的调查不是普查,我们无法量化每个因素的贡献。”他说。

策略游戏或持久模拟中的容忍度更低。资源必须仍然相加,角色必须记住之前的事件,类似的行动必须产生感觉公平的结果。一个模型忘记了条约或发明了不可用的物品,不仅仅写了一条尴尬的句子;它改变了玩家计划的状态。

这有助于解释为什么调查中只有一个策略或管理游戏和四个模拟游戏。

**开放的输出仍然需要固定规则**

该论文建议使用生成和验证的方法来填补自由表达和可靠游戏之间的差距。 “一个实用的原则是让模型提出一个解释,而游戏引擎控制后果。”徐志岳说。一个模型可以建议一个事件、行动或结果,但游戏状态、资源、进展、评分和胜利或失败条件的改变可以独立验证。

这是一个混合设计,而不是模型替换游戏逻辑。授权目标、隐藏状态、验证器、缓存结果和fallback行为给生成的响应后果,让玩家可以理解。

1001夜(https://www.1001nights.ai/),样本中的一个研究项目,将玩家主导的故事与生成的故事和视觉变化结合起来,而不是将会话视为一个孤立的聊天窗口。

该调查是一个定性的地图,而不是每个使用生成式AI的游戏的普查。研究人员搜索了学术工作、商店页面、官方网站和公开演示,然后对每个候选者进行手动判断。他们承认边缘分类,且大多数保留的例子都是早期访问版本、演示或研究原型。该论文也是一个预印本,并没有经过同行评审。

徐志岳建议使用实际游戏而不是精心制作的演示进行三个测试:AI是否快速响应以保持游戏的节奏;类似的行动是否遵循一致的规则,重要的决定是否在长时间的游戏中生存;系统如何处理模糊、极端或剥削的输入。

研究人员也计划修订地图,而不是将53个游戏样本视为固定的。徐志岳说,未来版本将重复搜索,接受公共提交并发布版本化的数据集更新。一个主要机制标签将保持不变,伴随着多个AI机制的次要标签。

这种不稳定性也影响了所有权。一个与托管模型相关的游戏可能会随着其提供商更新模型或安全政策而改变,且可能会在服务关闭时停止工作。保存可执行文件并不能保存相同的游戏,除非其模型、提示和状态系统也保持可用。