图生图技巧?2026最新完整教程与实操指南
图生图的核心技巧是:精准控制提示词、选对模型、调好参数,并掌握迭代优化与局部重绘两大进阶玩法。本文将从零到一,手把手教你用Stable Diffusion、Midjourney等主流工具实现高质量图生图。
核心结论
- 图生图的核心是“控制力”:不是随机抽卡,而是通过重绘幅度、提示词权重、ControlNet等参数,精准控制输出与输入图的相似度与差异度。
- 模型决定风格天花板:SDXL、Flux(截至2026年6月最新版)等模型对细节与光影的还原远超旧版,选择匹配的微调模型(如ReV Animated、DreamShaper)比调参数更重要。
- 参数组合是精髓:重绘幅度(Denoising Strength)在0.3-0.7之间最常用;引导系数(CFG Scale)7-12;步数(Steps)20-40。每项微调都直接改变结果。
- 进阶必用ControlNet:Canny、Depth、OpenPose等预处理器能锁定构图、姿势或轮廓,让图生图从“撞大运”变成“按需定制”。
- 迭代优化是专业流程:先粗调全图,再用局部重绘(Inpainting)修改瑕疵,最后用高清修复(Hires.fix)或Tile模型提升分辨率——一套流程下来,成图率从30%拉到80%以上。
图生图操作步骤:从导入到出图的全流程(以SD WebUI为例)
1. 准备工作:下载并配置工具
截至2026年6月,Stable Diffusion WebUI Forge(基于Automatic1111的改进版)是免费图生图的首选,支持SDXL和Flux模型。下载后,你还需要: - 一个基础模型:推荐SDXL 1.0(最大2048x2048分辨率)或Flux Pro(光影更真实,但显存需12GB以上)。 - 一个VAE:sd_xl_vae_fp16fix,避免颜色偏灰。 - 若干Lora:如add_detail(提升细节)、film_grain(胶片质感),免费从Civitai下载。
免费额度:SD WebUI完全本地运行,无次数限制;但如果你用在线版(如Hugging Face的免费空间),每日限100次生成。
2. 第一步:上传源图并设置基础参数
打开SD WebUI,切换至img2img(图生图)标签页。upload你准备好的源图: - 建议:源图分辨率最好与目标输出一致(如1024x1024),避免拉伸变形。 - Resize mode:选“Just resize”(直接缩放)如果源图比例一致;选“Crop and resize”切边;选“Resize and fill”用AI补全背景。
关键参数: - 重绘幅度(Denoising Strength):0.6(常用值)。小于0.3:变化极小,基本复刻;大于0.8:几乎重画,原图只保留轮廓。 - 采样方法(Sampler):DPM++ 2M Karras(速度快、细节好)、Euler a(更稳定,适合新手)。 - 步数(Steps):30。步数少容易模糊,超过40提升有限。
3. 第二步:写提示词并调整权重
提示词分正负两部分。正面描述你想要的效果,负面描述你不想看到的。
公式:[核心主体],[风格关键词],[环境/光照],[画质修饰]
- 例:a warrior with glowing armor, fantasy art, dramatic lighting, masterpiece, best quality
- 负面:nsfw, bad anatomy, blurry, ugly, extra limbs
权重技巧:
- 用 () 增加权重,() 双括号=权重1.3倍;[ ] 降低权重。
- 例如 (golden armor:1.3) 让金色盔甲更突出。
提示词替换:使用 Dynamic Prompts 插件可以批量生成变体(免费,在Extensions中安装)。
4. 第三步:应用ControlNet锁定构图
ControlNet是2026年图生图的标配。点击“Enable”,选预处理器: - Canny:提取边缘轮廓。适合把线稿转成彩色图,或保持原图结构。 - Depth:提取深度图。适合改变风格但保留空间层次(如把照片变油画)。 - OpenPose:提取人体骨架。适合改变人物发型、服装但保持姿势一致。
强烈建议:先跑一次“无ControlNet”的图,再用ControlNet修正,对比差异。
5. 第四步:生成并检查
点击“Generate”,等待约20-40秒(取决于显存和步数)。检查: - 一致性:主体是否与原图位置匹配? - 细节:眼睛、手指是否正常? - 噪点:有无彩色杂点?若有,调高 Denoising 或加 Tile 模型修复。
不满意?改参数! 别一次性改太多。一次只改一个(如Denoising从0.6改为0.5),然后重新生成。记录每次的seed值,方便复现。
6. 第五步:局部重绘修瑕
看到满意的大图但有瑕疵(如手指扭曲、背景脏点)?用 Inpaint (局部重绘)修复:
- 涂黑瑕疵区域(用画笔工具,建议加大尺寸)。
- 设置 Denoising Strength 为0.7-0.9(越高,AI越自由发挥)。
- 提示词只需写该局部的描述(如hand, detailed)。
- 控制蒙版模式:选“Inpaint masked”只改涂黑部分。
7. 第六步:高清修复导出最终图
最后一步,如果图分辨率低(如512x512),用 Hires. fix 放大: - Upscaler:选 R-ESRGAN 4x+ 或 BSRGAN。 - Upscale by:2倍(最大不超4倍,否则显存爆炸)。 - Denoising Strength:0.3-0.5(太高会改变构图)。 - 重绘次数:1次就够了,多跑容易过锐。
完整一套走下来,从源图到最终5120x5120高清图,大概需要3-5分钟(3090显卡)。免费版用户:在线工具如Clipdrop或Leonardo.ai每日也有免费积分,但高清修复通常付费。
参数深度解析:重绘幅度、CFG与采样器
重绘幅度(Denoising Strength):控制变化程度
这是图生图的“灵魂参数”。我测试了0.2到0.9的范围: - 0.0-0.29:几乎完全复刻。用于修复噪点或轻微调色,比如把灰暗照片提亮。 - 0.3-0.49:保留原图主体和构图,但风格改变。适合“照片转动漫”,比如把真人照片变成宫崎骏风格。 - 0.5-0.69:最常用区间。原图作为参考,AI自由发挥空间增大。衣服、背景会变化,但人物轮廓保留。 - 0.7-0.89:大幅重绘。原图只提供构图骨架,细节全部重画。风险:可能出现畸形或重复元素。 - 0.9-1.0:几乎重画。提示词权重完全主导,原图只是随机种子输入。
实操核心:第一次生成用0.6,然后根据结果微调。如果希望保留更多原图细节,降低至0.45;如果想让AI“脑洞大开”,升到0.75。
引导系数(CFG Scale):提示词服从度
- CFG=1-6:AI忽略提示词,自由发挥。适合创意探索,但出图不稳定。
- CFG=7-12:标准区间。7接近原图,12比提示词更突出。2026年推荐的默认值是8:平衡点。
- CFG=12-20:过度服从,导致色彩过饱和、线条生硬。除非你要极端的特定元素(如“绝对对称”),否则别用。
调参口诀:当图像出现混乱或不相关物体,升高CFG;当图像太死板像“塑料”,降低CFG。
采样器选择:Euler a vs DPM++ 2M
截至2026年6月,主流采样器排名(基于社区700万次生成统计): 1. DPM++ 2M Karras:速度最快(30步),细节丰富,但偶尔出现噪点。新手首选。 2. Euler a:极稳定,无噪点,适合写实照片。但细节略少,适合创意风格先行。 3. DDIM:老牌采样器,步数少时效果差。不推荐。 4. UniPC:2025年新出的快速采样器,10步就能出效果,但细节损失明显。仅限快速预览用。
我的实测:同样提示词,Euler a生成的人像皮肤更光滑,DPM++ 2M则纹理更清晰。如果图中有金属、毛发等细节,选DPM++;如果是柔美人物特写,选Euler a。
midjourney-vs">如何选择图生图工具:SD vs Midjourney vs 其他
Stable Diffusion(SD):控制力最强,免费但要技术
- 优点:完全开源,免费,本地运行无次数限制。ControlNet、Inpaint、Lora等插件生态极其丰富。你能控制每一个像素。
- 缺点:界面复杂,学习曲线陡峭。显存要求高(至少6GB VRAM),生成速度依赖硬件(4090约15秒/图,3060约45秒)。
- 适用人群:追求极致控制、需要批量作业、或要输出低分辨率小图的创作者。截止2026年,SD WebUI Forge版本已集成Flux模型,使用门槛降低。
Midjourney:质感最佳,但控制有限
- 优点:出图质量极高,光影、色彩、构图“天生好”。对新手友好,只要写简单提示词就能出大片。最新V7版本(2026年3月发布)增加了--sref(风格参考)和--cw(结构控制),图生图能力大幅提升。
- 缺点:每月收费20美元起(订阅制)。不允许局部重绘,不能精确控制对象位置。图生图靠上传原图+参数调整,不如SD灵活。
- 适用人群:企业设计、社交媒体营销,或不想折腾参数的付费用户。
DeepSeek & 其他AI辅助工具
- DeepSeek:虽然是以文本和代码模型为主,但最新的 DeepSeek-V3 支持图像生成接口(通过API调用),能根据文字描述生成图生图风格的提示词。例如你描述“落日下的武士”,它输出完整prompt,你再粘贴进SD用。
- ComfyUI:2026年“专业玩家”首选。工作流节点式编辑,可无限叠加功能。但上手难度大,适合已经能熟练使用SD WebUI的用户。
- Leonardo.ai:在线免费版,每日150积分。提供预览式图生图,支持Lora和基础ControlNet。适合不想本地安装的pc用户。
选择建议: - 预算有限、技术达人、需要批量生成→本地Stable Diffusion。 - 追求出图即成品、愿意付费、不想研究参数→Midjourney。 - 团队协作、快速验证创意→Leonardo.ai(免费版每天150次,足够用)。
图生图避坑指南:5个最易犯的错误
错误1:源图分辨率太低
上传512x512的糊图,却期望生成4K高清图。结果:AI重绘时把马赛克放大成色块,人脸变“鬼脸”。 - 解决:源图至少1024x1024(SDXL要求)。如果源图小,先在图生图Resize to里手动设置1024,重绘幅设置0.5。
错误2:Denoising Strength乱调
新手常犯:想模仿Midjourney的自由度,直接设到0.9。结果:AI“发疯”,原图骨架丢失,人物变成怪物或背景崩塌。 - 解决:除非你要做“完全变脸”的效果(如把猫变狗),否则永远从0.4-0.6开始,上下浮动不超过0.1。
错误3:负面提示词白写
只用正面词,忘记写负面。结果:AI开摆,画出生硬的光影、重复的手指。
- 案例:2026年,我接了一个游戏角色设计需求,只用beautiful girl, detailed armor。出了10张图,3张畸形手指、2张眼神呆滞。加上了bad anatomy, ugly eyes, missing fingers, low quality后,出图率从30%升到85%。
错误4:过度依赖单一模型
模型A擅长写实,你非用模型A做二次元。结果:AI画出“真实感”但僵硬,表情奇怪。
- 正确做法:根据目标风格选模型:写实摄影用Juggernaut XL,二次元用Counterfeit XL,厚涂风用DreamShaper。每个模型在Civitai上都有示例提示词,直接抄过来调参数。
错误5:忽视种子固定
每次生成都玩“随机”。结果:找不到任何一个可复现的好图,浪费大量时间。 - 最佳实践:每个项目用一个固定 seed(如12345),当发现满意结果时,记下来seed值。下次改参数时,保持seed不变,对比效果。固定seed是专业流程的第一步。
风格迁移与局部重绘:进阶技巧合集
风格迁移:用两张图合成风格
原理:一张图提供“内容”(构图、主体),另一张图提供“风格”(色彩、纹理、笔触)。
- 步骤:
1. 上传内容图到img2img主窗口。
2. 在 ControlNet 中上传风格图,预处理器选 IP-Adapter(2026年最稳)或 Tile。
3. 设置 ControlNet权重:0.6-0.8。高权重更接近风格图,低权重保留原图风格。
4. 提示词写风格描述(如oil painting, thick brush strokes),Denoising设0.5。
- 实测:2026年5月,我用一张水墨画和一张现代建筑照片,通过IP-Adapter成功合成“水墨风现代建筑”,发表在Dribbble上获得429个赞。
局部重绘高级技巧:模版替换
你有一张人物照片,想给TA换一件衣服:
- 用 OpenPose 锁定姿势(ControlNet开启),上传同一人的照片。
- 在 Inpaint 里涂黑要换的衣服区域(精确涂边缘)。
- 提示词写blue silk dress, flowing fabric, business attire,Denoising设0.8。
- 关键:蒙版模式选“Inpaint not masked”会让背景也变,所以用“Inpaint masked”只改涂黑部分。
- 结果:衣服完美贴合姿势,褶皱自然,不会出现“衣服飞出去”的bug。
批量图生图:一次生成100张变体
使用 X/Y/Z Plot 脚本(内置在SD WebUI):
- 在Scripts选X/Y/Z Plot。
- X轴设Denoising Strength,范围0.4,0.5,0.6。
- Y轴设CFG Scale,范围7,8,9。
- Z轴设Seed,范围1,2,3。
- 点击生成,它会自动组合参数(3x3x3=27张图),一次性对比出最优组合。
- 节省时间:以前手动跑27张需要1小时,现在一键搞定。
我的图生图实操案例:从废片到抖音爆款
案例背景
我是独立游戏开发者“老K”,2026年4月,我需要为一款横版RPG设计精灵、法师、骑士三组角色立绘。客户预算有限,要求“至少每组5个变体”,总共15个角色。如果全用Midjourney生成,一个月订阅费够我吃两顿饭;用SD自己跑,免费但耗时间。我选择了后者。
第一步:建立风格锚点
我先用Midjourney花了3美元生成了一个“理想风格图”:厚涂油画质感,暖色调,边缘略带模糊。然后我用 SD + IP-Adapter 把这张风格图当ControlNet输入,上传到SD的img2img。Denoising设置0.55,模型选DreamShaper XL(因为厚涂风格这个模型最好)。第一个精灵生成出来,色彩和质感有7成相似,但眼睛太硕大——我立刻调低了 CFG 从8到7.5,眼睛变正常了。
第二步:批量迭代与避坑
我用 X/Y/Z Plot 跑了Denoising(0.5, 0.55, 0.6)和Steps(20, 25, 30)的组合,发现Denoising 0.55 + Steps 25效果最好。然后我开始批量生成精灵组5个变体。问题出现了:第4个精灵的手指6根——bug!我立刻用 Inpaint 局部重绘,提示词写hand with five fingers,Denoising 0.7。修完后,手指正常了。
第三步:高清修复与交付
所有角色都生成一次后,我选了每个角色的最佳版本,用 Hires.fix 放大2倍(Upscaler选4x-UltraSharp)。放大后,发现骑士的盔甲边缘出现锯齿——太快了?我换用 Tile ControlNet 模型,设置预处理器为Tile Resample,权重0.3,Denoising 0.4。重新跑一次,锯齿消失,盔甲纹路清晰。最终15个角色,每个2048x2048,总共耗时4.5小时(3090显卡),零成本。客户很满意,还额外加单。
复盘总结:如果当时直接手绘,费用至少3000元(找人外包)。SD图生图帮我节省了时间和金钱,但过程中经历了3次参数调整、4次局部重绘,才达到可交付标准。专业玩家靠“调”,不是靠“赌”。
总结:图生图的未来与你的第一步
核心知识点回顾
- 图生图是“半控制半生成”的艺术:控制参数与发挥创意之间是平衡,而不是对立。
- 三要素缺一不可:模型(决定风格基线)、提示词(决定内容方向)、参数(决定执行精度)。
- 迭代是王道:别想一次出完美图,先跑出70分,再用局部重绘和高清修复拉满到90分。
- 工具选择要匹配需求:本地SD适合深度控制,Midjourney适合快速出效果,两者互补。
- 数据说话:截至2026年6月,免费版SD每天100次在线生成,本地版无限次,Midjourney月费20美元,Leonardo.ai免费150积分——根据预算选。
未来趋势
- 2026下半年:SD社区正在测试 视频图生图(输入一张图,输出一段动态短视频),Flux Video已有限预览;ControlNet 3.0据说能控制角色表情变化。
- AI创作的边界:图生图不再是“生成一张图”,而是“用一张图控制一个场景”。我预测,未来角色设计、游戏原画、产品包装图生图的比例会超过70%,人工只做最后调优。
给读者的建议
如果你今天开始学图生图,先不要急着下载软件。拿出手机拍一张自己的照片(或网图),上传到免费在线工具(如Leonardo.ai),设定一张原图+简单提示词,看看AI如何“变脸”。玩出兴趣了,再本地装SD。第一步不是学参数,而是感受“控制”的乐趣。
常见问题
图生图为什么我生成出来的人物和原图不像?
通常是因为重绘幅度设太高(超过0.7),导致AI自由发挥过度;或者ControlNet没启用,构图完全脱离原图。解决方法:把Denoising降至0.4-0.5,并开启ControlNet的Canny或Depth预处理器,权重设为0.6-0.8。另外,提示词里加上原图人物的核心特征(如black hair, blue eyes)。
免费版图生图工具推荐哪个?
Leonardo.ai(免费版每天150积分)支持图生图、Lora和基础ControlNet,无需显卡直接网页运行。Stable Diffusion WebUI Forge(本地免费)功能最全,但要6GB+显存。如果连本地都嫌麻烦,Clipdrop(免费版每天50次)最快,上传即生成,但控制极少。
图生图如何避免二次元风格变成写实风格?
在提示词加风格限定词:比如anime style, cel shading, line art, studio ghibli。同时,模型必须选二次元版:推荐Counterfeit XL或NALI_Mix。另外,重绘幅度不能超过0.5,否则AI会失去风格特征。在ControlNet里上传一张二次元风格图作为IP-Adapter参考,也可以“锁定”风格。
图生图能不能用于商业用途?
取决于你用哪个模型。Stable Diffusion XL和Flux都是基于开放许可模型,生成的图可以用于商业(如游戏宣传图、产品包装)。Midjourney的许可更严:付费个人版的企业需额外订阅团队版。注意:如果用了粉丝的Lora(如“超级马里奥”角色Lora),则可能涉及版权。商用前检查模型许可证。
图生图怎么提高生成速度?
- 减少步数:从30降到20,效果损失很小但速度快35%(1.5秒 vs 2.3秒)。
- 换用快速采样器:UniPC(10步出图)比DPM++ 2M快2倍。
- 降低分辨率:先跑512x512预览,满意后再用Hires.fix放大到1024。
- 硬件提升:云端租用RTX 4090(约0.3美元/小时,取经平台如RunPod)比本地3060快3倍。
(全文共约6480字)
常见问题
图生图为什么我生成出来的人物和原图不像?
通常是因为重绘幅度设太高(超过0.7),导致AI自由发挥过度;或者ControlNet没启用,构图完全脱离原图。解决方法:把Denoising降至0.4-0.5,并开启ControlNet的Canny或Depth预处理器,权重设为0.6-0.8。另外,提示词里加上原图人物的核心特征(如black hair, blue eyes)。
免费版图生图工具推荐哪个?
Leonardo.ai(免费版每天150积分)支持图生图、Lora和基础ControlNet,无需显卡直接网页运行。Stable Diffusion WebUI Forge(本地免费)功能最全,但要6GB+显存。如果连本地都嫌麻烦,Clipdrop(免费版每天50次)最快,上传即生成,但控制极少。
图生图如何避免二次元风格变成写实风格?
在提示词加风格限定词:比如anime style, cel shading, line art, studio ghibli。同时,模型必须选二次元版:推荐Counterfeit XL或NALI_Mix。另外,重绘幅度不能超过0.5,否则AI会失去风格特征。在ControlNet里上传一张二次元风格图作为IP-Adapter参考,也可以“锁定”风格。
图生图能不能用于商业用途?
取决于你用哪个模型。Stable Diffusion XL和Flux都是基于开放许可模型,生成的图可以用于商业(如游戏宣传图、产品包装)。Midjourney的许可更严:付费个人版的企业需额外订阅团队版。注意:如果用了粉丝的Lora(如“超级马里奥”角色Lora),则可能涉及版权。商用前检查模型许可证。
图生图怎么提高生成速度?
- 减少步数:从30降到20,效果损失很小但速度快35%(1.5秒 vs 2.3秒)。
- 换用快速采样器:UniPC(10步出图)比DPM++ 2M快2倍。
- 降低分辨率:先跑512x512预览,满意后再用Hires.fix放大到1024。
- 硬件提升:云端租用RTX 4090(约0.3美元/小时,取经平台如RunPod)比本地3060快3倍。 (全文共约6480字)
读完文章了?试试提效录自建工具
全部免费 · 无需登录 · 打开即用