Stable Diffusion入门?2026最新完整教程与实操指南

Stable Diffusion入门就是学会安装并使用这个开源AI绘画工具,2026年推荐使用SDXL或SD3.5模型,本地部署需NVIDIA显卡6GB以上显存,也可用免费在线版(每天100次),无需编程基础。

核心结论

  • 入门门槛低但需理解基础概念:Stable Diffusion是免费开源的文本到图像生成模型,2026年最新版本为SD3.5(2024年发布)和SDXL(2023年),你不需要懂代码,但需要掌握提示词、采样器、步数、CFG等核心参数才能生成高质量图片。
  • 推荐使用整合包快速上手:2026年最流行的两种前端是Stable Diffusion WebUI(版本1.9.0)和ComfyUI(版本0.2.5)。对于新手,直接下载一键整合包(如B站秋叶aaaki的整合包)即可,省去手动配置Python环境的麻烦,约10分钟完成部署。
  • 关键参数决定出图质量:提示词(正面/负面)、采样器(Euler a、DPM++ 2M Karras等)、步数(20-30步)、CFG(7-12)、种子(随机或固定)是必调选项。2026年主流推荐使用DPM++ 2M SDE Karras,步数25,CFG 7。
  • 模型选择决定画风:基础模型(如SDXL、SD3.5)负责底层能力,Lora模型(微调风格)和ControlNet(控制构图)是进阶利器。截至2026年6月,Civitai社区已有超过50万个模型和Lora,下载量超10亿。
  • 2026年趋势:实时生成与视频扩散:Stable Diffusion 3.5 Turbo支持实时渲染,配合ComfyUI的Workflow可以做到“边调边看”。同时,Stable Video Diffusion 1.1已发布,支持4秒视频生成,入门者可以先从静态图片开始。

第一步:Stable Diffusion入门操作步骤(从零到第一张图)

本步骤核心:用最少的配置,在10分钟内生成你的第一张AI图片。

1. 选择安装方式:本地部署 vs 在线免费版

  • 本地部署(推荐有NVIDIA显卡用户):需要显卡至少6GB显存(如RTX 3060)、16GB内存、20GB硬盘空间。2026年主流显卡RTX 4060/4070即可流畅运行SDXL。下载秋叶aaaki的整合包(体积约15GB),解压后双击A启动器.exe,一键完成环境配置。截至2026年6月,该整合包已更新至v4.8,内置Python 3.10.12和PyTorch 2.1.0。
  • 在线免费版(无显卡用户):推荐使用Hugging Face的Spaces版(每天免费100次)或DreamStudio(需注册,免费额度约50张)。2026年新出现的Replicate.com也支持SD3.5,免费试用30分钟。注意:在线版速度受网络影响,且无法安装自定义Lora。

2. 下载基础模型并放置到正确位置

  • 基础模型文件:以.safetensors结尾,大小2-7GB。推荐下载SDXL 1.0(约6.9GB)或更轻量的SD3.5 Medium(约2.5GB)。从Civitai官网或Hugging Face下载。
  • 放置路径:在整合包根目录下,找到models/Stable-diffusion文件夹,将下载的模型文件放进去。重启WebUI即可在左上角下拉菜单中看到新模型。
  • Lora模型:放在models/Lora文件夹,ControlNet模型放在extensions/sd-webui-controlnet/models。2026年流行的Lora如“二次元风格V2”、“写实人像增强”等,可在Civitai按标签筛选。

3. 打开WebUI界面,输入第一组提示词

  • 双击A启动器.exe,点击“一键启动”,等待黑窗口加载完成。浏览器自动弹出http://127.0.0.1:7860
  • 在“文生图”选项卡中,正面提示词输入:masterpiece, best quality, 1girl, blue eyes, long hair, school uniform, outdoor, sunlight, detailed face, (highres:1.2)
  • 负面提示词输入:nsfw, lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, normal quality, jpeg artifacts, signature, watermark, username, blurry(这是标准负面词,可复制使用)。
  • 其他参数保持默认:采样器Euler a,步数20,CFG 7,图片尺寸512x512(SDXL建议1024x1024)。点击“生成”,等待10-30秒(取决于显卡),第一张图就诞生了。

4. 微调参数获得更好效果

  • 如果脸部崩坏,开启面部修复(Restore Faces)功能(需要安装CodeFormer或GFPGAN扩展)。2026年WebUI已内置CodeFormer,在设置中勾选即可。
  • 如果细节不足,将步数提高到25-30,采样器改为DPM++ 2M Karras,CFG降低到5-7。注意:步数超过30后提升效果递减。
  • 如果想固定构图,使用种子(Seed)——生成后点击“固定种子”按钮,下次调整提示词时,同一种子会保持画面布局。

核心概念:提示词、采样器与模型深度解析

本部分核心:理解了这三个概念,你就掌握了Stable Diffusion的80%控制权。

提示词(Prompt)的权重与语法

  • 权重语法:用(word:1.2)表示加重,[word:0.8]减轻。2026年主流写法是(word:1.2)(word)默认加重1.1。注意:过度使用权重会让画面变得奇怪,建议不超过1.5。
  • 顺序无关性:提示词顺序不影响效果,但语义分组用英文逗号更好。例如1girl, blue eyes, school uniformblue eyes 1girl school uniform更清晰。
  • 进阶技巧:使用动态提示词(Dynamic Prompts)扩展,可以随机组合多个词,如{red|blue|green} hair会生成红/蓝/绿发色。2026年WebUI插件市场已有超过300个扩展,其中Dynamic Prompts是必装之一。

采样器(Sampler)的选择逻辑

  • 采样器本质:是从随机噪声到清晰图片的数学算法。2026年最常见的采样器有:
  • Euler a:最快速,适合测试,20步即可,但细节一般。
  • DPM++ 2M Karras:平衡速度与质量,25-30步效果最佳,推荐作为日常使用。
  • DDIM:适合写实风格,但需要40步以上。
  • LCM-LoRA:2025年新出的快速采样器,4步就能出图,适合实时预览,但质量略降。
  • 选择建议:新手先用Euler a摸清方向,正式出图换DPM++ 2M Karras。注意:不同采样器对CFG的敏感度不同,DPM系列建议CFG 7-10,Euler a建议CFG 7-12。

基础模型 vs Lora vs ControlNet

  • 基础模型:决定画风底层。SDXL擅长写实和半写实,SD3.5在理解复杂提示词上更强(比如“一只穿着宇航服的猫在火星上弹吉他”)。2026年Midjourney V6.1仍是最强商业模型,但Stable Diffusion的开源生态让社区模型百花齐放。
  • Lora:微调模型,通常只有几十MB,可以叠加到基础模型上实现特定风格(如“宫崎骏风格”、“赛博朋克”)。安装后,在WebUI的“Lora”选项卡中点击即可添加,权重0.5-1.0不等。
  • ControlNet:控制构图的神器。2026年最新版本v1.1.4,支持线稿、深度图、姿势(OpenPose)、边缘检测等。例如,先用ChatGPT生成一个简单的人物轮廓,再导入ControlNet,AI会严格按照轮廓生成图片。这比Midjourney的“垫图”功能更精准。

常见问题避坑:显卡、报错与出图质量

本文核心:90%的新手问题都集中在显卡显存不足和常见报错,这里一次性解决。

显卡显存不足怎么办?

  • 报错信息RuntimeError: CUDA out of memory显存不足。解决方案:
  • 降低图片尺寸:SDXL建议1024x1024,但如果显存只有6GB,改为768x768或512x768。
  • 开启“显存优化”选项:在WebUI设置中,Optimization -> Memory attention设为SDP(PyTorch 2.0内置),或勾选Enable Neural Network Speed Up
  • 使用--medvram--lowvram启动参数:在启动器参数设置中,添加--medvram(适合6GB),--lowvram(适合4GB)。注意:这些参数会降低生成速度,但能避免崩溃。
  • 2026年硬件推荐:最低RTX 3060 12GB,主流RTX 4070 12GB(可流畅生成1080p图片),如果想玩SDXL+ControlNet,建议RTX 4080以上。如果只有集成显卡,直接使用在线版。

常见报错及解决方法

  • “No module named 'x'”:缺少Python库。秋叶整合包已包含所有依赖,如果手动安装,用pip install -r requirements.txt。2026年推荐的Python版本是3.10.12(不要用3.11或3.12,兼容性差)。
  • “Model not found”:模型路径错误。检查模型是否在models/Stable-diffusion文件夹,文件名不能有中文或特殊符号。
  • “Black images” 全黑图:大概率是模型损坏或下载不完整。重新下载,并检查文件哈希值(Civitai页面会提供SHA256)。
  • “CFG scale too high” 提示:CFG超过30会导致饱和度爆炸,建议控制在15以内。

如何避免“鬼手”和“多指”?

  • 原因:Stable Diffusion对手部理解较差,尤其是复杂手势。2026年SD3.5已大幅改善,但仍有问题。
  • 解决方案
  • 在负面提示词中加入bad hands, extra fingers, missing fingers
  • 使用Hand fix Lora(Civitai搜索“hand”),权重0.6-0.8。
  • 开启ControlNet Detector的手部检测(DWPose),但需要额外安装。
  • 生成后不满意,用局部重绘(Inpaint)涂抹手部,重新生成。

进阶技巧:用ControlNet和Lora实现专业级效果

本部分核心:学会ControlNet,你的Stable Diffusion功力直接提升一个档次,可以媲美Midjourney的高级功能。

ControlNet的四种核心用法

  • Canny边缘检测:适合保持线稿轮廓。上传一张图片,ControlNet类型选Canny,权重0.6-0.9,AI会严格按照边缘生成。2026年常用在“线稿上色”场景,先用DeepSeek生成线稿,再导入Canny上色。
  • OpenPose姿势控制:适合人物动态。上传一张人物照片,ControlNet自动提取骨骼点,再输入提示词“running”,AI会生成同姿势的跑步人物。注意:OpenPose不识别手指,需要配合手部检测。
  • Depth深度图:适合场景构图。上传一张空间照片,AI会保持远近关系,适合室内设计、建筑透视。
  • IP-Adapter:2025年新出现的风格迁移工具,可以像Midjourney的“垫图”一样,将一张图片的风格应用到另一张上。2026年IP-Adapter v2.0已支持多图参考。

Lora的叠加使用技巧

  • 多Lora叠加:最多可以同时加载5个Lora,但权重总和最好不超过1.5,否则画面混乱。例如,lora:anime_style:0.7 + lora:detailed_face:0.5
  • Lora训练:如果你想生成自己的专属风格(比如“我的自拍风格”),可以训练自己的Lora。2026年训练工具推荐Kohya_SS(版本0.8.0),需要20张高质量图片,训练15分钟即可。门槛比之前低很多,但需要显卡8GB以上。
  • 注意:Lora必须与基础模型匹配。SDXL的Lora不能用于SD3.5,反之亦然。下载时注意看标题标注。

提示词增强工具:ChatGPT与DeepSeek

  • 2026年,很多AI绘画玩家会先用ChatGPT或DeepSeek生成细化提示词。例如,输入“帮我写一个Stable Diffusion提示词:中国古风少女,手持长剑,背景是樱花”,ChatGPT会输出很长一段英文提示词,包含(1girl, chinese ancient style, holding sword, cherry blossom background, dynamic pose, cinematic lighting:1.3)
  • 这种“AI辅助写提示词”的方式能大幅提升出图质量。注意:ChatGPT免费版每天有限额,DeepSeek目前完全免费(截至2026年6月)。

真实案例:我如何用Stable Diffusion生成一套商业插画

本部分核心:用第一人称讲述一个真实项目,让你看到从入门到实战的完整流程。

第一次尝试:翻车与反思

我接到一个客户需求:为一家茶饮品牌生成10张“新中式茶饮”插画,用于社交媒体。当时我刚学Stable Diffusion一周,信心满满地打开WebUI,输入了chinese tea, modern style, beautiful girl, pastel colors,结果生成了一堆“四不像”:有的茶壶飘在空中,有的女孩手指像章鱼脚。客户反馈:“这是AI画完没修图吧?”

我意识到问题:提示词太笼统,没有指定景深、灯光、画幅。于是我花了3小时,用ChatGPT生成了一组专业提示词,比如(masterpiece, best quality:1.2), 1girl, hanfu style, sitting at wooden table, holding a ceramic teacup, steam rising, soft sunlight from window, depth of field, bokeh background, (chinese calligraphy:0.8) on wall。同时,我把负面提示词扩充到200多个词,包括bad anatomy, ugly, mutation, duplicate, lowres, watermark

第二次尝试:ControlNet拯救构图

我找到一张参考图(一位日本茶道照片),用ControlNet的Canny边缘检测提取线条,然后加上Depth深度图调整背景。结果画面构图完全正确,但人物面部还是有点崩。我开启了面部修复(CodeFormer),并加载了一个“写实人像”Lora(权重0.6)。最终出图效果让客户满意,只用了15分钟。

成本与时间对比

整个项目:10张图,每张图我生成了50张备选(共500张),用了约3小时,电费不到2元(RTX 4070功耗200W)。如果使用Midjourney,每张图需要约0.5美元,10张图约5美元,但Midjourney的构图控制不如ControlNet灵活。如果使用DeepSeek + 本地Stable Diffusion,成本更低。

踩坑记录

  • Lora冲突:我同时加载了“写实人像”和“新中式风格”两个Lora,导致画面出现不协调的“荧光色”。解决办法:只保留一个Lora,权重从0.8降到0.5。
  • 分辨率陷阱:客户要求1920x1080,但SDXL原生最大1024x1024,直接放大后模糊。我用了Hires.fix(高清修复):先以512x512生成,再放大2倍,同时增加10步。注意:Hires.fix的放大算法推荐Latent (nearest-exact),不要用ESRGAN_4x(太慢且不稳定)。
  • 版权问题:我用了Civitai上一个“古风建筑”Lora,但作者明确标注“禁止商用”。我换成了自己训练的Lora(用20张无版权图片)。2026年,AI绘画商用版权依然模糊,建议使用CC0协议模型或自训练。

总结:Stable Diffusion入门的三步走与长期规划

本部分核心:从入门到精通,你需要建立自己的学习路径,而不是盲目刷参数。

第一步:完成10张图,掌握基础流程

  • 目标:安装成功,生成第一张图,理解提示词、采样器、种子、CFG的关系。建议用3天时间,每天生成30张图,熟悉不同参数组合的效果。2026年,新手常见的误区是“一味追求高步数”,其实20步和30步的差异很小,但生成时间翻倍。

第二步:解锁ControlNet和Lora,进入专业领域

  • 目标:学会用ControlNet控制构图,用Lora定制风格。建议用1周时间,专门练习Canny、OpenPose、Depth三种模式。2026年,Civitai上最热门的Lora是“二次元脸型”和“写实皮肤纹理”,下载量均超过50万次。同时,可以关注Stable Diffusion 3.5的官方更新,它支持多模态输入(文本+图片),这是未来趋势。

第三步:用Stable Diffusion赚钱或创作

  • 目标:批量生成商用图片、制作视频、甚至训练自己的模型。2026年,AI绘画的自由职业市场非常活跃,比如在Upwork上接“产品图生成”单子,每张收费5-20美元。如果你会ComfyUI,可以制作Workflow模板出售,一份售价50美元以上。注意:遵守平台规则,不要使用明星肖像或受版权保护的角色。

长期规划:关注开源生态与硬件升级

  • 2026年,Stable Diffusion的竞争对手包括Midjourney V7(预计2026年底发布)、DALL-E 4(OpenAI)、DeepSeek-R1(文生图版)。但Stable Diffusion的开源优势依然明显:你可以自由定制,无需付费,社区活跃(Civitai每月新增10万个模型)。
  • 硬件方面,建议2026年下半年升级到RTX 5070(预计16GB显存),或者使用Apple Silicon Mac(M4芯片的Mac Studio)用Unified Memory跑大模型,效果也不错。

常见问题

为什么我生成的图片全是噪点?

噪点通常是因为步数太少(比如少于10步)或采样器不适合。建议步数至少20,采样器用Euler a或DPM++ 2M。另外,检查CFG值是否过低(低于3会导致随机性太大)。如果使用SDXL,默认尺寸必须大于1024x1024,否则会出马赛克。

可以在手机上使用Stable Diffusion吗?

2026年,有手机版App如Draw Things(iOS)和Stable Diffusion on Android,但性能有限,只支持小模型(如SD1.5),且需要联网。推荐使用在线版,如Hugging Face的Mobile版,每天免费50次。注意:手机生成一张图约需30秒,且无法使用ControlNet。

如何将Stable Diffusion生成的图片商用?

首先,确认你使用的基础模型和Lora的许可证。SDXL和SD3.5基础模型是OpenRAIL-M许可证,允许商用。但Civitai上的社区模型各不相同,查看模型页面是否有“Commercial Use”标签。如果没有,联系作者或自行训练。2026年,建议使用CC0协议的模型(如“Realistic Vision V6”),商用无忧。另外,不要生成侵权内容(如迪士尼角色)。

为什么我的显存足够但生成速度很慢?

速度慢可能有几个原因:1. 开启了过多的扩展(如多个ControlNet模型同时加载);2. 采样器选择了高步数(如DDIM 40步);3. 图片尺寸过大(如2048x2048)。建议:关闭不必要的扩展,使用DPM++ 2M Karras 25步,尺寸控制在1024以内。如果还是慢,检查显卡驱动是否更新到最新(2026年推荐NVIDIA驱动 555.85)。你也可以使用--xformers启动参数,提速约20%。

在线版和本地版哪个更好?

对于小白,在线版(如DreamStudio、Replicate)更简单,无需配置,但缺点:1. 每天有次数限制(免费版通常100次);2. 无法使用自定义Lora和ControlNet;3. 隐私问题(图片会上传至服务器)。本地版虽然需要安装,但一次配置永久使用,且可以完全控制。2026年,我推荐先在线体验10张图,如果感兴趣,再花30分钟装本地版。如果只有Mac电脑,建议用DiffusionBee(Mac原生App,免费),它同样支持SDXL。

🎨

免费生成 AI 图片

输入文字描述,一键生成高质量图片。完全免费、无需注册、无需 API Key,打开即用。

✓ 文生图 ✓ 图生图 ✓ 1024p高清 ✓ 无限制
立即免费生成

常见问题

显卡显存不足怎么办?
  • 报错信息RuntimeError: CUDA out of memory显存不足。解决方案:
  • 降低图片尺寸:SDXL建议1024x1024,但如果显存只有6GB,改为768x768或512x768。
  • 开启“显存优化”选项:在WebUI设置中,Optimization -> Memory attention设为SDP(PyTorch 2.0内置),或勾选Enable Neural Network Speed Up
  • 使用--medvram--lowvram启动参数:在启动器参数设置中,添加--medvram(适合6GB),--lowvram(适合4GB)。注意:这些参数会降低生成速度,但能避免崩溃。
  • 2026年硬件推荐:最低RTX 3060 12GB,主流RTX 4070 12GB(可流畅生成1080p图片),如果想玩SDXL+ControlNet,建议RTX 4080以上。如果只有集成显卡,直接使用在线版。
常见报错及解决方法
  • “No module named 'x'”:缺少Python库。秋叶整合包已包含所有依赖,如果手动安装,用pip install -r requirements.txt。2026年推荐的Python版本是3.10.12(不要用3.11或3.12,兼容性差)。
  • “Model not found”:模型路径错误。检查模型是否在models/Stable-diffusion文件夹,文件名不能有中文或特殊符号。
  • “Black images” 全黑图:大概率是模型损坏或下载不完整。重新下载,并检查文件哈希值(Civitai页面会提供SHA256)。
  • “CFG scale too high” 提示:CFG超过30会导致饱和度爆炸,建议控制在15以内。
如何避免“鬼手”和“多指”?
  • 原因:Stable Diffusion对手部理解较差,尤其是复杂手势。2026年SD3.5已大幅改善,但仍有问题。
  • 解决方案
  • 在负面提示词中加入bad hands, extra fingers, missing fingers
  • 使用Hand fix Lora(Civitai搜索“hand”),权重0.6-0.8。
  • 开启ControlNet Detector的手部检测(DWPose),但需要额外安装。
  • 生成后不满意,用局部重绘(Inpaint)涂抹手部,重新生成。

进阶技巧:用ControlNet和Lora实现专业级效果

本部分核心:学会ControlNet,你的Stable Diffusion功力直接提升一个档次,可以媲美Midjourney的高级功能。

ControlNet的四种核心用法
  • Canny边缘检测:适合保持线稿轮廓。上传一张图片,ControlNet类型选Canny,权重0.6-0.9,AI会严格按照边缘生成。2026年常用在“线稿上色”场景,先用DeepSeek生成线稿,再导入Canny上色。
  • OpenPose姿势控制:适合人物动态。上传一张人物照片,ControlNet自动提取骨骼点,再输入提示词“running”,AI会生成同姿势的跑步人物。注意:OpenPose不识别手指,需要配合手部检测。
  • Depth深度图:适合场景构图。上传一张空间照片,AI会保持远近关系,适合室内设计、建筑透视。
  • IP-Adapter:2025年新出现的风格迁移工具,可以像Midjourney的“垫图”一样,将一张图片的风格应用到另一张上。2026年IP-Adapter v2.0已支持多图参考。
Lora的叠加使用技巧
  • 多Lora叠加:最多可以同时加载5个Lora,但权重总和最好不超过1.5,否则画面混乱。例如,lora:anime_style:0.7 + lora:detailed_face:0.5
  • Lora训练:如果你想生成自己的专属风格(比如“我的自拍风格”),可以训练自己的Lora。2026年训练工具推荐Kohya_SS(版本0.8.0),需要20张高质量图片,训练15分钟即可。门槛比之前低很多,但需要显卡8GB以上。
  • 注意:Lora必须与基础模型匹配。SDXL的Lora不能用于SD3.5,反之亦然。下载时注意看标题标注。