我是一个独立开发者,我注意到我的实际工作流程是:生成艺术,粘贴截图到ChatGPT,并问“哪一个更好?”“这个是否适合我的游戏?”“它是否与其他部分一致?”我把它作为艺术总监使用,每次粘贴一个截图。因此,我自动化了这个循环,结果有些发现让我惊讶,所以我分享了工作流程。
循环如下:
- 生成一批候选人
- 一个廉价的模型进行初步筛选并对整个批次进行排名
- 最好的图像与当前的冠军进行对决(两张图像在同一背景下),只有在清晰胜利时才会取代
- 强大的模型进行最后确认:交付/迭代/拒绝,带有得分和具体修复清单
- 提示从修复清单重写,循环重复,直到“交付”的图像在第二次无视意见中幸存
调节出乎意料地是关键部分。评判者从真空中得分:每个评判都带有相同的固定集合已发布的艺术作为参考,带有明确的说明每个艺术作品在等级中的位置(最弱8.0,平均8.3,最佳8.7)。没有固定在框架中的东西,模型会重新标准化为它上次看过的东西。
令人惊讶的事情是:
- 绝对得分在不同评判之间漂移;
- 双向对决不带有两张图像的得分
- 拒绝“略微更好”的胜利会阻止一个流程从侧面进入一个没有人选择的风格
- 判官在“哪一个更好”方面表现出色,但在“这个alpha是否干净”,就完全无用,于是将这些检查移动到决定性的代码外
- 一次性批量质量信号仅需要2个模型调用(筛选+确认)
结果截至目前:一款移动商店屏幕在第4批次时以8.4/10的得分交付,并被切割成26张单独命名的透明PNG图像;一条一词的简短说明(“不同情绪”)变成了10个一致的角色图像。
如何在大规模生产中处理质量控制?当一组资产超过几十个时,什么样的风格会漂移?
全方位披露:我正在将这个工具打造成一个工具——它被称为Artkiln(artkiln.dev)。本文中提到的两个项目都在一个只读的演示中,可以看到每次运行的完整记录,包括失败的批次,无需注册:https://demo.artkiln.dev/demo/the-devils-club - 如果您有任何关于评判设置的疑问,我都乐意回答。
评论 (0)