我在一家IT公司工作,主要从事与技术相关的项目。最近,我们一直在与基于LLM的检测模型合作,而这些模型有时会做出令人惊讶的糟糕决定,我们就尝试使用中间件来控制和过滤他们的决策过程,几乎像一个人工的“额叶”。

这给我了一个想法:如果我把这个概念推得更远呢?

使用Ollama和Qwen,我正在构建一个灵活的系统,受人类神经系统处理的方面的启发,部分基于大学论文中描述的研究。

该架构使用一个提示构建器,从几个不同的系统中接收信息。每个NPC都有一个JSON角色-profile,包含性格特征、背景信息、行为倾向和生活史。旁边,一个上下文管理器跟踪角色当前的情况:他们在哪里、交互发生的时间、他们正在做什么以及周围发生了什么。

此外,该系统还包括间歇性记忆、情绪状态和生理需求,使NPC(理论上)能够根据内部状态和以前的经历对特定刺激做出不同的反应。

这是我最有兴趣的部分。

目标是超越基本的方法,即基本粘贴一个聊天机器人到NPC。相反,我试图构建一个轻量级的认知架构,它在LLM之前过滤和结构化信息,应用一个不断演化的规则、状态、记忆和上下文变量集。

因此,LLM不负责做出所有决定。它在一个受限的认知框架中运行。

的想法是,使结果行为感觉更不机械,并且奇怪的是,更加自然。

到目前为止,我已经取得了令人惊讶的成果。最长的响应时间我见过大约是1秒钟,当时我问NPC同时处理三个不同的事情。

我还在实验中,试图看这个架构可以推得多远。如果类似这样的架构可以在一个普通的消费者电脑上可靠运行,那么它可能会成为一些极具沉浸力的NPC系统的基础。

在有人说,““但对话仍然是AI生成的,”之前,是的,但也... 不完全。

NPC角色发言的结构、词汇倾向、句子模式、性格约束、行为规则和可能反应都是预定义的。模型主要学习如何在这些界限内的特定角色进行通信,并根据当前情况生成一个响应。

换句话说,模型不会被告知:

“你是角色X。回答玩家。”

它接收一个结构化的角色性格、记忆、当前情绪状态、生理需求、环境上下文、最近事件和玩家动作和对话的代表。最终,这个系统也可以包含多个NPC之间的交互。

我只是想分享这个实验,并问:这个架构听起来是否真正有趣,你认为它看起来像另一个过于雄心勃勃的实验注定失败吗?

这个系统比较技术化,所以欢迎提问。我是一个资深的IT开发人员,我很乐意进入架构、实现、性能或任何部分的推理。