嘿 guys,
我已经进展到游戏的某个阶段,目前对概念感到满意,所以今天我开始关注视觉效果。使用Claude作为提示(和调整)和CGPT生成图像,效果不错。我几乎达到了90%想要的精灵形象,但无法解决最后10%的问题。
Claude建议我尝试以下工作流程(以下说明是AI生成的复制粘贴的AI生成的说明):
停止描述每次生成的风格,而是训练它一次。推荐的设置是:
- ComfyUI(基于节点的本地图像生成)——免费
- Flux.1作为基准模型
- 在我的好图像上训练一个LoRA,以便风格被烘焙,而不是通过提示
- ControlNet来锁定姿势/比例(我的角色都需要相同的尺寸+方向)
目标:空白脸的外星人物种+扁平的海报化风格成为模型的一部分,所以我停止与之抗争,ControlNet来处理“始终相同的身体,始终面向左边”的事。
你需要的实际内容 + 文件大小(粗略)
- ComfyUI – 免费,开源
- Flux dev checkpoint – \~23GB for the full fp16,或者\~11GB如果你抓取fp8版本(fp8运行得很轻,几乎没有质量损失)
- Flux text encoders – t5xxl(\~5GB fp8 / \~9GB fp16)+ clip_l(\~250MB)
- Flux VAE – \~330MB
- 一个用于Flux的ControlNet模型 – 大约从\~1.5GB到\~6GB不等,取决于哪一个
- 训练的LoRA(输出) – 小,像20-150MB不等,取决于设置
- 训练图像 – 我在使用\~20-30个我的最好的ChatGPT渲染
实际上你需要一个好的GPU。Flux在12GB+ VRAM上很高兴;你可以在fp8/GGUF版本上挤出8GB。
成本
在本地运行所有内容 = 免费(只是磁盘空间 + 电力)。如果你没有训练GPU,云LoRA训练器就可以在 $2-3 a training run,所以仍然几乎没有任何成本。
回到我,人类:
我尝试了一下。第一次在本地做任何事情。质量比ChatGPT差得多。几乎立即拔了插头,但决定再加5张图像训练LoRA。输出从20%提高到60%,甚至给了我一些很好的想法(哪个GPT没有)。不幸的是,我被锁定在GPT上直到8点,所以我无法继续训练我的本地AI。晚上和明天我会继续实验,如果有任何突破,我会更新我的工作流程。
TLDR: CGPT在生成我想要的风格方面取得了90%的成功。切换到本地AI(第一次)来训练自己的模型(见上述工作流程)。当前状态比GPT差得多,但看起来很有希望。我们很快会再次报告。
评论 (0)