我一直在尝试将小模型(1B~1Gb)作为游戏的核心功能来运行。这些模型在一定程度上是可玩的,但需要大量测试和调整才能正常运行。

背景信息——其中一款游戏是《艺术开发大亨》,采用Janus Pro模型。Janus大约有10亿参数,可以生成图像并分析图像。游戏循环围绕创作艺术、获得评价、出售作品展开。游戏进程通过接触不同媒介积累经验,从而提升幕后提示词的质量,这意味着你可以创作出更优秀的艺术作品。

我尝试过的做法:

所有项目都配备了一套测试提示语组合,我会批量运行提示进行尝试,看看哪些方法能可靠且一致地运作。比如我会生成50-100个样本,通常逐一检查输出结果,快速为结果打上标签,然后分析数据中标签的分布规律。

我发现的情况:

  • 模型类型很关键(扩散模型 vs 顺序生成模型)。Janus是逐像素生成器,当我尝试生成简单图像(比如白底上的苹果)时,Janus会陷入全部生成白色的困境。而SD Turbo(稍大的扩散模型)则会产生模糊的背景。

  • 它们在某些方面表现出色(猫、狗、人脸),但对于不熟悉的内容则表现糟糕。不过它们的基础知识库非常广泛,所以如果你要求画一只睡着的猫,输出会很差,但如果你要求画稀有动物,它通常能认识。

  • 与其使用单一的长提示,不如拆分成多个简短提示。Janus会用类似“颜色好吗?”→是……“构图好吗?”→一般……这样的系统来标记。

  • 我能够对输出质量进行分级。1级铅笔风格是简单的儿童画,7级则相当于带有动态背景的精湛艺术品。

  • 它有一个糟糕的程序化生成备用方案,可能会被玩家钻空子利用。我认为有一个备份方案很重要,但必须确保游戏在不使用它时不会被滥用。

还有人在做类似的事吗?你们在构建什么?

我将暂停这个项目的开发,转而尝试另一款基于AI模型的游戏。不过如果有人感兴趣,代码在GitHub - MichaelTJ/ArtDevTycoon上,可玩版本在Art Dev Tycoon。我保留了开发选项,方便大家自行尝试。