AI绘画入门:图生图原理与实操指南
大家好,今天来学习图生图的基本概念。
AI的第一次大规模破圈,应该就是各大平台短视频中出现的AI绘画特效。只需用手机对着镜头自拍,就能实时生成二次元风格的画面。这类视频普遍拥有不错的流量,例如这种、这种,甚至包括一些“翻车”案例——比如把嘟嘟唇画成M唇,或者把小狗画成人脸。大家有没有想过,这些效果是如何实现的?
这就不得不提到Stable Diffusion这项AI绘画技术。它于2022年8月被免费开源,供公众使用。它的诞生不同于以往的AI绘画应用,比如短视频平台的AI滤镜、美图秀秀的AI美化功能,或某些封闭式AI绘图程序。Stable Diffusion能在秒级时间内生成一张高质量图像,实现将一张照片用完全不同的绘画风格重新表达——这种技术,在SD中被称为“图生图”。借助图生图,我们不仅可以把二次元人物转为写实风格,也能把真人照片转化为二次元、油画、机甲等多样化风格。
接下来进入正式学习阶段,分为两个主要板块:
一、图生图原理
本板块分为两个小节:一是图生图的基本概念解析,帮助大家理解其运行逻辑;二是图片如何传递信息——即输入图片对最终输出的影响,以及如何正确输入图片、调整参数。
1. 基本概念解析
图生图和文生图一样,也依赖正向提示词与反向提示词。文字提供语义信息,而图片则提供视觉结构信息。经过上节课的学习,大家已了解文生图的基础逻辑:文字会影响生成结果,但无法完全控制其随机性。例如,使用相同提示词“白色裙子”,不同迭代步数下生成的图像仍存在模糊、不可控的偏差。
这种信息解读偏差在日常生活中也很常见。比如玩“你画我猜”时,即使画得再认真,他人也常误解原意。再如甲方提出设计需求,设计师却难以准确还原预期效果——这本质上是语言传递信息时产生的失真。
如何解决这个问题?最直接的方式,是提供参考图。例如,想要一张五彩斑斓、富有设计感的海报,直接给设计师一张符合预期的样图,比口头描述更高效、更直观。图生图正是基于这一逻辑:我们提供一张目标效果的参考图,AI便以此为基础进行重绘与风格迁移。
举例来说,名画《亨利·怀特夫人》中,人物身着白色长裙,背景为灰棕色,配有红色沙发。若仅用文字提示“白蓝色长裙、华贵长裙、红色沙发、灰棕色背景”,文生图生成的结果虽有相似元素,但与原作差异明显,可能需反复尝试数十次甚至上百次才能接近目标。而采用图生图,则可直接导入原图,经去噪与像素级重绘处理——AI识别每个区域的颜色与结构(如白色衣料、红色沙发、棕灰色背景),再按指定风格进行重构,最终生成高度贴近原图结构、但风格已转变为二次元的新图像。
2. 操作方法
图生图操作可归纳为三个基本步骤:导入图片、编写提示词、调整参数。
我们以“将真人照片转为二次元风格”为例,实地操作一次:
- 导入图片:打开Stable Diffusion,进入图生图界面。界面中央有一个方框,用于上传参考图。有两种导入方式:双击方框选择文件,或直接拖拽图片至该区域。
- 编写提示词:以最简提示词“a boy”为例。
- 调整参数:
- 重绘幅度(Denoising Strength):控制输出与原图的偏离程度。数值越高,风格变化越大。真人转二次元建议设置为0.6–0.8,此处设为0.7。
- 尺寸:保持与原图一致。本例为600×800,故宽度设为600、高度设为800。
- 采样方法与步数:选用Euler a或DPM++ 2M Karras,步数设为30。
- 提示词引导系数(CFG Scale):设为7即可。
- 质量增强提示词:可在正向提示词中加入“masterpiece, best quality, high resolution”等通用优质前缀;反向提示词中加入“low quality, bad anatomy, deformed hands, blurry”等常见负面项。
点击生成后,可以看到:即使只输入简单提示词“a boy”,AI仍能较好还原姿态、服装颜色、背包及背景等关键信息。但当前参数与提示词较为基础,仍有较大优化空间——这就引出下一板块:参数与提示词的技术解析。
二、参数与提示词技术解析
1. 提示词书写要点
回顾刚才的生成结果,人物整体相似,但细节缺失明显:棕色帽子、墨镜均未呈现。这说明图生图对提示词精度有更高要求——需基于画面内容,精准描述关键视觉元素。