Hello,大家好!这节课我们一起来学习如何搭建文生图工作流,以及各关键节点和参数的具体作用。

首先看最左侧的节点——CheckPoint加载器,它是放置大模型的地方。我们可以将大模型简单理解为一位“厨师”:有的擅长中华料理,有的专精东南亚菜系,有的精通日料。无论后续参数如何调整,图像的整体风格基调都由所选大模型决定。

点击打开CheckPoint加载器,可以看到不同风格的大模型,例如真实系、动漫系、全能系等,各有侧重。除了这些常见类型,还有大量其他模型可供选择。本节我们先以真实系模型为例,点击右上角“执行”,生成的图像呈现写实风格;再切换为动漫系模型并重新执行,画面立刻呈现出鲜明的动漫质感。

CheckPoint加载器有三个输出:模型(model)、CLIP文本编码器(clip)和VAE(vae)。我们依次来看:

  • 模型输出连接至K采样器,这是整个工作流的核心节点,可类比为“中央处理器”。所有运算都在此完成,最终通过解码生成图像。
  • CLIP输出连接到两个CLIP文本编码器节点,分别对应正面提示词负面提示词输入。正面提示词即你希望图像中出现的内容,例如“one girl, forest”表示“一个女孩在森林中”;负面提示词则是你不希望出现的元素,例如输入“flower”可显著降低画面中花朵的比重。

提示词编写时,词汇间需用英文逗号分隔。语言不通时可借助翻译工具(如网易有道翻译)辅助。例如想表达“水手服”,可先翻译再复制粘贴至提示词框。生成结果基本符合提示词语义,但可能存在手部或面部细节粗糙等问题——这类问题将在后续的高清修复环节中解决。

关于提示词权重:将光标置于关键词上,按Ctrl + 上箭头可提高权重(如1.0→1.1→1.15→1.25),增强该词对画面的影响;按Ctrl + 下箭头则降低权重。例如将“flower”的权重设为1.6,花朵几乎消失;若降至0.5,则花朵又会重新显现。

再看下方的空节点(Empty Latent Image),它控制图像尺寸与批量数量。其三个参数分别为:

  • 宽度高度:决定图像分辨率与比例。例如设为512×768,即得到2:3竖版图像;
  • 批次大小(Batch Size):指定单次运行生成的图片张数。设为4后,执行会一次性输出4张图。

接下来重点解析K采样器的参数:

  • 随机种子(Seed):相当于图像的“身份证号”。相同参数+相同种子,结果完全一致;不同种子则生成各异图像。勾选“固定种子”后,多次执行将保持输出不变。
  • 步数(Steps):代表去噪迭代次数,类比为“擦拭脏玻璃的次数”。步数过低(如3步)图像模糊难辨;7步稍清晰但仍缺细节;40步已能呈现丰富细节。但并非越高越好——80步相较40步耗时翻倍,画质提升却不足5%,因此推荐设置在20–30之间,取中值25较为稳妥。
  • CFG值(Classifier-Free Guidance Scale):控制图像与提示词的匹配程度。CFG=1时约束极弱,输出偏离提示;通常设为5–8之间,本例采用6.5。
  • 采样器(Sampler)与调度器(Scheduler):共同决定去噪方式。常用组合为采样器选DPM++ 2M,调度器选Karras。
  • 降噪起始值(Denoise):该参数将在下一节“图生图”中详细说明。

K采样器的输出是Latent图像(潜空间图像),需经VAE解码器转换为可视的像素图像。可将Latent图像比作刚出锅未摆盘的菜肴,而VAE解码则如同专业摆盘,使其成为最终呈现的精美成品。

实际生成中常遇到画面灰暗、色彩不饱满的问题。这是因为默认VAE解码效果有限。解决方法是:断开原有VAE连接,在VAE解码节点处加载专用VAE模型。例如生成动漫图时,选择animevae,再执行即可明显提升亮度与鲜活感。

以上即为ComfyUI中文生图工作流的核心结构与关键参数说明。