我想看看哪款更便宜的LLM在玩策略棋盘游戏时表现最好。

GPT-5 Mini、Claude Haiku 4.5 和 Gemini Flash-Lite 在一台VPS上全天候进行一场定居与贸易棋盘游戏的对决。这些比赛会被直播到Twitch上,包含Elo评级、每局AI成本、统计数据,甚至还有语音,让模型们可以互相嘲讽。

我设置了五个Claude Code会话,就像一个小型开发团队:一个担任主架构师,另外四个分别负责游戏引擎、统计/编排、广播UI以及部署/直播。

架构师将我的想法转化为规格说明,分配任务,审核其他智能体构建的内容,并在任何改动上线前独立验证其变更。现在大约有900个自动化测试。

有一次我发现模型不小心作弊了,因为游戏日志泄露了隐藏信息,比如某人买了哪张发展卡或抢走了什么资源。我不得不扔掉整个赛季的结果,并添加了一个适当的编辑系统。

另一次,一个只有一行的bash脚本错误悄无声息地杀掉了生产环境的看门狗进程。还有一次,由于PulseAudio和ffmpeg之间的奇怪交互,直播流以6帧每秒的速度运行了好几个小时。

但现在整个系统基本可以自行运转了。

比赛持续进行,评级自动更新,支出设有上限并实时追踪(目前中位成本约每局0.19美元),系统能够从故障中恢复,获胜者发表胜利感言,而当一个模型移动时间过长时,其他模型会起哄。

我还构建了观众互动模式,但目前处于关闭状态,要等到频道拥有更多观众后再启用:包括聊天投票引发的混乱事件、观众可以坐下与AI对战的对局,以及聊天阵营合作对抗当前AI冠军的团队活动(类似“Twitch能击败AI吗?”这样的活动/功能)。

这些内容与正式的评级联赛完全分开,以确保竞技结果不受影响。

现在,我主要就是观看联赛,并向我的AI小开发团队提交功能请求。
编辑:

Twitch:https://www.twitch.tv/aitriestosettle