TLDR:在使用前沿托管模型时,你有哪些保持艺术风格一致性的技巧?(见帖子底部我尝试过的方法)
背景:
早先从Stable Diffusion刚推出时,我就在开源程序Auto1111上接触了生成式AI。自那以后我一直关注本地开发——从SDXL发展到Flux,再到如今众多现代模型如Chroma、Qwen Edit等(以及所有视频生成模型)。我们从Auto1111迁移到了ComfyUI,这似乎已成为本地生成的标配。
总之,在SDXL之后出现了一个障碍:当模型从标签式提示转向自然语言时,它们在某种程度上失去了艺术家名字与标签的关联。也就是说,SDXL模型能理解"Edward Gorey风格"的含义,而现代模型除非使用LoRA,否则都无法做到。如今的问题在于:你能获得惊人的提示理解能力,但风格遵循度却从未像过去那样精准——除非你训练一个LoRA。(我可以详细展开,但简而言之,尽管SDXL的提示理解能力很差,但它渲染的"Edward Gorey"+其他标签组合,在风格忠实度上仍远超我见过的任何前沿模型,这与当前图像模型的训练方式有关。)
正因如此,除非你花大力气调整提示或事后修图,否则很容易分辨出Midjourney和ChatGPT生成的图片;而本地生成的作品(若工作流合理)则难以察觉,因为它们没有每个前沿模型强加给生成内容的"污点"偏差。
总之,抛开这些不谈:
你是如何让前沿模型坚持特定风格的?
我在Codex中尝试过的方法:
* 创建一个包含若干固定样本图片的本地环境,代表该风格
* 编写详细提示,描述风格和渲染期望
* 强制AGENTS.md流程为:先读取包含提示说明的SKILL,检查参考素材,然后使用高推理模型(如Sol High)进行生成
* 设立一个独立的子代理作为"评论家",将参考素材与生成的图标对比,若不符合则退回主代理重新生成,直至达标
* 设立另一个独立子代理作为"执行者",以适当格式保存文件
我发现,如果提供一个待制作的艺术表格,这种方法能防止风格偏离(尽管无法解决我在"背景"部分描述的问题),但至少需要Sol High模型。Terra或更低级别的模型似乎无法充分指导底层图像生成模型以克服其"污点"偏差。
你一直在用什么方法?Ultra或Astra是否远胜于此?无论我们使用什么,最终是否都取决于底层图像生成模型?
评论 (0)