[Part One]中,我们询问了一个模型是否可以制作游戏。这次,我们关注的是优化, 而不是单次质量。我们将五个浏览器游戏原型交给了Fable 5、Grok 4.5和GPT-5.6 Sol进行优化。我们每次运行15次,一个指令每次:改变一个清晰的东西,并且做得好,返回整个文件。有三个循环:模型选择更改,一个人在事先写15条笔记,或者一个人在每次构建中玩,并在下一次笔记中写。一些观察: \- 模型自我评分并不总是与盲目评审评分一致。 \- 指导循环始终在优化第15次循环时达到顶峰。 \- 人机交互循环是评审员评分最高的。 \- 盲目评审无法评估游戏的“感觉”。这是人类输入可以产生最高影响的地方。我们在[gameover.com Labs](https://gameover.com/labs/ai-can-create-a-game-can-it-improve-one)中分享了我们的写作和可玩的构建。我们仍然有很长的路要走,以改进我们的Fable 5游戏。