你还记得AI21 Labs的《是人还是AI?》吗?
我很喜欢它的核心问题“我是在和人聊天还是在和AI聊天?”并以此为起点开发了《第四思维》——一款带有别样趣味的浏览器端社交推理游戏。

与一对一对话不同,小队模式设有四个座位,其中隐藏着一个搭载Gemini的玩家。玩家们互发短消息,追踪可疑点,最终投票淘汰一人。

当前版本通过Vertex AI使用Gemini Flash模型。Gemini实时生成隐藏玩家的消息,并参与决策和投票,成为实际游戏循环的一部分,而不仅是开发阶段使用的工具。

难点不在于让Gemini说话,而在于让它听起来不像助手。冗长、工整的回复会立刻显得可疑,但随机加入错误也并不自然。每局游戏都需要平衡:短回复、有限信息、时机把握、不完美的推理、一致性、延迟和API成本。

根据我最近的统计,AI在小队模式追踪对局中的胜率为46.5%。这表明难度平衡得还算合理,但胜率并未揭示玩家实际上注意到哪些破绽。

给所有开发AI驱动游戏的同行:在社交互动中,哪些因素最快暴露LLM角色——用词选择、回复时机、过度解释、过度一致性,还是过于谨慎的决策?

游戏直接在浏览器中运行,无需下载即可体验:

[https://the4thmind.com/]

如果你尝试一局,我特别想知道是哪条消息或行为让你怀疑到AI。