Stable Diffusion入门?2026最新完整教程与实操指南
Stable Diffusion入门就是学会安装并使用这个开源AI绘画工具,2026年推荐使用SDXL或SD3.5模型,本地部署需NVIDIA显卡6GB以上显存,也可用免费在线版(每天100次),无需编程基础。
核心结论
- 入门门槛低但需理解基础概念:Stable Diffusion是免费开源的文本到图像生成模型,2026年最新版本为SD3.5(2024年发布)和SDXL(2023年),你不需要懂代码,但需要掌握提示词、采样器、步数、CFG等核心参数才能生成高质量图片。
- 推荐使用整合包快速上手:2026年最流行的两种前端是Stable Diffusion WebUI(版本1.9.0)和ComfyUI(版本0.2.5)。对于新手,直接下载一键整合包(如B站秋叶aaaki的整合包)即可,省去手动配置Python环境的麻烦,约10分钟完成部署。
- 关键参数决定出图质量:提示词(正面/负面)、采样器(Euler a、DPM++ 2M Karras等)、步数(20-30步)、CFG(7-12)、种子(随机或固定)是必调选项。2026年主流推荐使用DPM++ 2M SDE Karras,步数25,CFG 7。
- 模型选择决定画风:基础模型(如SDXL、SD3.5)负责底层能力,Lora模型(微调风格)和ControlNet(控制构图)是进阶利器。截至2026年6月,Civitai社区已有超过50万个模型和Lora,下载量超10亿。
- 2026年趋势:实时生成与视频扩散:Stable Diffusion 3.5 Turbo支持实时渲染,配合ComfyUI的Workflow可以做到“边调边看”。同时,Stable Video Diffusion 1.1已发布,支持4秒视频生成,入门者可以先从静态图片开始。
第一步:Stable Diffusion入门操作步骤(从零到第一张图)
本步骤核心:用最少的配置,在10分钟内生成你的第一张AI图片。
1. 选择安装方式:本地部署 vs 在线免费版
- 本地部署(推荐有NVIDIA显卡用户):需要显卡至少6GB显存(如RTX 3060)、16GB内存、20GB硬盘空间。2026年主流显卡RTX 4060/4070即可流畅运行SDXL。下载秋叶aaaki的整合包(体积约15GB),解压后双击
A启动器.exe,一键完成环境配置。截至2026年6月,该整合包已更新至v4.8,内置Python 3.10.12和PyTorch 2.1.0。 - 在线免费版(无显卡用户):推荐使用Hugging Face的Spaces版(每天免费100次)或DreamStudio(需注册,免费额度约50张)。2026年新出现的Replicate.com也支持SD3.5,免费试用30分钟。注意:在线版速度受网络影响,且无法安装自定义Lora。
2. 下载基础模型并放置到正确位置
- 基础模型文件:以
.safetensors结尾,大小2-7GB。推荐下载SDXL 1.0(约6.9GB)或更轻量的SD3.5 Medium(约2.5GB)。从Civitai官网或Hugging Face下载。 - 放置路径:在整合包根目录下,找到
models/Stable-diffusion文件夹,将下载的模型文件放进去。重启WebUI即可在左上角下拉菜单中看到新模型。 - Lora模型:放在
models/Lora文件夹,ControlNet模型放在extensions/sd-webui-controlnet/models。2026年流行的Lora如“二次元风格V2”、“写实人像增强”等,可在Civitai按标签筛选。
3. 打开WebUI界面,输入第一组提示词
- 双击
A启动器.exe,点击“一键启动”,等待黑窗口加载完成。浏览器自动弹出http://127.0.0.1:7860。 - 在“文生图”选项卡中,正面提示词输入:
masterpiece, best quality, 1girl, blue eyes, long hair, school uniform, outdoor, sunlight, detailed face, (highres:1.2)。 - 负面提示词输入:
nsfw, lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, normal quality, jpeg artifacts, signature, watermark, username, blurry(这是标准负面词,可复制使用)。 - 其他参数保持默认:采样器Euler a,步数20,CFG 7,图片尺寸512x512(SDXL建议1024x1024)。点击“生成”,等待10-30秒(取决于显卡),第一张图就诞生了。
4. 微调参数获得更好效果
- 如果脸部崩坏,开启面部修复(Restore Faces)功能(需要安装CodeFormer或GFPGAN扩展)。2026年WebUI已内置CodeFormer,在设置中勾选即可。
- 如果细节不足,将步数提高到25-30,采样器改为DPM++ 2M Karras,CFG降低到5-7。注意:步数超过30后提升效果递减。
- 如果想固定构图,使用种子(Seed)——生成后点击“固定种子”按钮,下次调整提示词时,同一种子会保持画面布局。
核心概念:提示词、采样器与模型深度解析
本部分核心:理解了这三个概念,你就掌握了Stable Diffusion的80%控制权。
提示词(Prompt)的权重与语法
- 权重语法:用
(word:1.2)表示加重,[word:0.8]减轻。2026年主流写法是(word:1.2)或(word)默认加重1.1。注意:过度使用权重会让画面变得奇怪,建议不超过1.5。 - 顺序无关性:提示词顺序不影响效果,但语义分组用英文逗号更好。例如
1girl, blue eyes, school uniform比blue eyes 1girl school uniform更清晰。 - 进阶技巧:使用动态提示词(Dynamic Prompts)扩展,可以随机组合多个词,如
{red|blue|green} hair会生成红/蓝/绿发色。2026年WebUI插件市场已有超过300个扩展,其中Dynamic Prompts是必装之一。
采样器(Sampler)的选择逻辑
- 采样器本质:是从随机噪声到清晰图片的数学算法。2026年最常见的采样器有:
- Euler a:最快速,适合测试,20步即可,但细节一般。
- DPM++ 2M Karras:平衡速度与质量,25-30步效果最佳,推荐作为日常使用。
- DDIM:适合写实风格,但需要40步以上。
- LCM-LoRA:2025年新出的快速采样器,4步就能出图,适合实时预览,但质量略降。
- 选择建议:新手先用Euler a摸清方向,正式出图换DPM++ 2M Karras。注意:不同采样器对CFG的敏感度不同,DPM系列建议CFG 7-10,Euler a建议CFG 7-12。
基础模型 vs Lora vs ControlNet
- 基础模型:决定画风底层。SDXL擅长写实和半写实,SD3.5在理解复杂提示词上更强(比如“一只穿着宇航服的猫在火星上弹吉他”)。2026年Midjourney V6.1仍是最强商业模型,但Stable Diffusion的开源生态让社区模型百花齐放。
- Lora:微调模型,通常只有几十MB,可以叠加到基础模型上实现特定风格(如“宫崎骏风格”、“赛博朋克”)。安装后,在WebUI的“Lora”选项卡中点击即可添加,权重0.5-1.0不等。
- ControlNet:控制构图的神器。2026年最新版本v1.1.4,支持线稿、深度图、姿势(OpenPose)、边缘检测等。例如,先用ChatGPT生成一个简单的人物轮廓,再导入ControlNet,AI会严格按照轮廓生成图片。这比Midjourney的“垫图”功能更精准。
常见问题避坑:显卡、报错与出图质量
本文核心:90%的新手问题都集中在显卡显存不足和常见报错,这里一次性解决。
显卡显存不足怎么办?
- 报错信息:
RuntimeError: CUDA out of memory或显存不足。解决方案: - 降低图片尺寸:SDXL建议1024x1024,但如果显存只有6GB,改为768x768或512x768。
- 开启“显存优化”选项:在WebUI设置中,
Optimization->Memory attention设为SDP(PyTorch 2.0内置),或勾选Enable Neural Network Speed Up。 - 使用--medvram或--lowvram启动参数:在启动器参数设置中,添加
--medvram(适合6GB),--lowvram(适合4GB)。注意:这些参数会降低生成速度,但能避免崩溃。 - 2026年硬件推荐:最低RTX 3060 12GB,主流RTX 4070 12GB(可流畅生成1080p图片),如果想玩SDXL+ControlNet,建议RTX 4080以上。如果只有集成显卡,直接使用在线版。
常见报错及解决方法
- “No module named 'x'”:缺少Python库。秋叶整合包已包含所有依赖,如果手动安装,用
pip install -r requirements.txt。2026年推荐的Python版本是3.10.12(不要用3.11或3.12,兼容性差)。 - “Model not found”:模型路径错误。检查模型是否在
models/Stable-diffusion文件夹,文件名不能有中文或特殊符号。 - “Black images” 全黑图:大概率是模型损坏或下载不完整。重新下载,并检查文件哈希值(Civitai页面会提供SHA256)。
- “CFG scale too high” 提示:CFG超过30会导致饱和度爆炸,建议控制在15以内。
如何避免“鬼手”和“多指”?
- 原因:Stable Diffusion对手部理解较差,尤其是复杂手势。2026年SD3.5已大幅改善,但仍有问题。
- 解决方案:
- 在负面提示词中加入
bad hands, extra fingers, missing fingers。 - 使用Hand fix Lora(Civitai搜索“hand”),权重0.6-0.8。
- 开启ControlNet Detector的手部检测(DWPose),但需要额外安装。
- 生成后不满意,用局部重绘(Inpaint)涂抹手部,重新生成。
进阶技巧:用ControlNet和Lora实现专业级效果
本部分核心:学会ControlNet,你的Stable Diffusion功力直接提升一个档次,可以媲美Midjourney的高级功能。
ControlNet的四种核心用法
- Canny边缘检测:适合保持线稿轮廓。上传一张图片,ControlNet类型选Canny,权重0.6-0.9,AI会严格按照边缘生成。2026年常用在“线稿上色”场景,先用DeepSeek生成线稿,再导入Canny上色。
- OpenPose姿势控制:适合人物动态。上传一张人物照片,ControlNet自动提取骨骼点,再输入提示词“running”,AI会生成同姿势的跑步人物。注意:OpenPose不识别手指,需要配合手部检测。
- Depth深度图:适合场景构图。上传一张空间照片,AI会保持远近关系,适合室内设计、建筑透视。
- IP-Adapter:2025年新出现的风格迁移工具,可以像Midjourney的“垫图”一样,将一张图片的风格应用到另一张上。2026年IP-Adapter v2.0已支持多图参考。
Lora的叠加使用技巧
- 多Lora叠加:最多可以同时加载5个Lora,但权重总和最好不超过1.5,否则画面混乱。例如,
lora:anime_style:0.7+lora:detailed_face:0.5。 - Lora训练:如果你想生成自己的专属风格(比如“我的自拍风格”),可以训练自己的Lora。2026年训练工具推荐Kohya_SS(版本0.8.0),需要20张高质量图片,训练15分钟即可。门槛比之前低很多,但需要显卡8GB以上。
- 注意:Lora必须与基础模型匹配。SDXL的Lora不能用于SD3.5,反之亦然。下载时注意看标题标注。
提示词增强工具:ChatGPT与DeepSeek
- 2026年,很多AI绘画玩家会先用ChatGPT或DeepSeek生成细化提示词。例如,输入“帮我写一个Stable Diffusion提示词:中国古风少女,手持长剑,背景是樱花”,ChatGPT会输出很长一段英文提示词,包含
(1girl, chinese ancient style, holding sword, cherry blossom background, dynamic pose, cinematic lighting:1.3)。 - 这种“AI辅助写提示词”的方式能大幅提升出图质量。注意:ChatGPT免费版每天有限额,DeepSeek目前完全免费(截至2026年6月)。
真实案例:我如何用Stable Diffusion生成一套商业插画
本部分核心:用第一人称讲述一个真实项目,让你看到从入门到实战的完整流程。
第一次尝试:翻车与反思
我接到一个客户需求:为一家茶饮品牌生成10张“新中式茶饮”插画,用于社交媒体。当时我刚学Stable Diffusion一周,信心满满地打开WebUI,输入了chinese tea, modern style, beautiful girl, pastel colors,结果生成了一堆“四不像”:有的茶壶飘在空中,有的女孩手指像章鱼脚。客户反馈:“这是AI画完没修图吧?”
我意识到问题:提示词太笼统,没有指定景深、灯光、画幅。于是我花了3小时,用ChatGPT生成了一组专业提示词,比如(masterpiece, best quality:1.2), 1girl, hanfu style, sitting at wooden table, holding a ceramic teacup, steam rising, soft sunlight from window, depth of field, bokeh background, (chinese calligraphy:0.8) on wall。同时,我把负面提示词扩充到200多个词,包括bad anatomy, ugly, mutation, duplicate, lowres, watermark。
第二次尝试:ControlNet拯救构图
我找到一张参考图(一位日本茶道照片),用ControlNet的Canny边缘检测提取线条,然后加上Depth深度图调整背景。结果画面构图完全正确,但人物面部还是有点崩。我开启了面部修复(CodeFormer),并加载了一个“写实人像”Lora(权重0.6)。最终出图效果让客户满意,只用了15分钟。
成本与时间对比
整个项目:10张图,每张图我生成了50张备选(共500张),用了约3小时,电费不到2元(RTX 4070功耗200W)。如果使用Midjourney,每张图需要约0.5美元,10张图约5美元,但Midjourney的构图控制不如ControlNet灵活。如果使用DeepSeek + 本地Stable Diffusion,成本更低。
踩坑记录
- Lora冲突:我同时加载了“写实人像”和“新中式风格”两个Lora,导致画面出现不协调的“荧光色”。解决办法:只保留一个Lora,权重从0.8降到0.5。
- 分辨率陷阱:客户要求1920x1080,但SDXL原生最大1024x1024,直接放大后模糊。我用了Hires.fix(高清修复):先以512x512生成,再放大2倍,同时增加10步。注意:Hires.fix的放大算法推荐
Latent (nearest-exact),不要用ESRGAN_4x(太慢且不稳定)。 - 版权问题:我用了Civitai上一个“古风建筑”Lora,但作者明确标注“禁止商用”。我换成了自己训练的Lora(用20张无版权图片)。2026年,AI绘画商用版权依然模糊,建议使用CC0协议模型或自训练。
总结:Stable Diffusion入门的三步走与长期规划
本部分核心:从入门到精通,你需要建立自己的学习路径,而不是盲目刷参数。
第一步:完成10张图,掌握基础流程
- 目标:安装成功,生成第一张图,理解提示词、采样器、种子、CFG的关系。建议用3天时间,每天生成30张图,熟悉不同参数组合的效果。2026年,新手常见的误区是“一味追求高步数”,其实20步和30步的差异很小,但生成时间翻倍。
第二步:解锁ControlNet和Lora,进入专业领域
- 目标:学会用ControlNet控制构图,用Lora定制风格。建议用1周时间,专门练习Canny、OpenPose、Depth三种模式。2026年,Civitai上最热门的Lora是“二次元脸型”和“写实皮肤纹理”,下载量均超过50万次。同时,可以关注Stable Diffusion 3.5的官方更新,它支持多模态输入(文本+图片),这是未来趋势。
第三步:用Stable Diffusion赚钱或创作
- 目标:批量生成商用图片、制作视频、甚至训练自己的模型。2026年,AI绘画的自由职业市场非常活跃,比如在Upwork上接“产品图生成”单子,每张收费5-20美元。如果你会ComfyUI,可以制作Workflow模板出售,一份售价50美元以上。注意:遵守平台规则,不要使用明星肖像或受版权保护的角色。
长期规划:关注开源生态与硬件升级
- 2026年,Stable Diffusion的竞争对手包括Midjourney V7(预计2026年底发布)、DALL-E 4(OpenAI)、DeepSeek-R1(文生图版)。但Stable Diffusion的开源优势依然明显:你可以自由定制,无需付费,社区活跃(Civitai每月新增10万个模型)。
- 硬件方面,建议2026年下半年升级到RTX 5070(预计16GB显存),或者使用Apple Silicon Mac(M4芯片的Mac Studio)用Unified Memory跑大模型,效果也不错。
常见问题
为什么我生成的图片全是噪点?
噪点通常是因为步数太少(比如少于10步)或采样器不适合。建议步数至少20,采样器用Euler a或DPM++ 2M。另外,检查CFG值是否过低(低于3会导致随机性太大)。如果使用SDXL,默认尺寸必须大于1024x1024,否则会出马赛克。
可以在手机上使用Stable Diffusion吗?
2026年,有手机版App如Draw Things(iOS)和Stable Diffusion on Android,但性能有限,只支持小模型(如SD1.5),且需要联网。推荐使用在线版,如Hugging Face的Mobile版,每天免费50次。注意:手机生成一张图约需30秒,且无法使用ControlNet。
如何将Stable Diffusion生成的图片商用?
首先,确认你使用的基础模型和Lora的许可证。SDXL和SD3.5基础模型是OpenRAIL-M许可证,允许商用。但Civitai上的社区模型各不相同,查看模型页面是否有“Commercial Use”标签。如果没有,联系作者或自行训练。2026年,建议使用CC0协议的模型(如“Realistic Vision V6”),商用无忧。另外,不要生成侵权内容(如迪士尼角色)。
为什么我的显存足够但生成速度很慢?
速度慢可能有几个原因:1. 开启了过多的扩展(如多个ControlNet模型同时加载);2. 采样器选择了高步数(如DDIM 40步);3. 图片尺寸过大(如2048x2048)。建议:关闭不必要的扩展,使用DPM++ 2M Karras 25步,尺寸控制在1024以内。如果还是慢,检查显卡驱动是否更新到最新(2026年推荐NVIDIA驱动 555.85)。你也可以使用--xformers启动参数,提速约20%。
在线版和本地版哪个更好?
对于小白,在线版(如DreamStudio、Replicate)更简单,无需配置,但缺点:1. 每天有次数限制(免费版通常100次);2. 无法使用自定义Lora和ControlNet;3. 隐私问题(图片会上传至服务器)。本地版虽然需要安装,但一次配置永久使用,且可以完全控制。2026年,我推荐先在线体验10张图,如果感兴趣,再花30分钟装本地版。如果只有Mac电脑,建议用DiffusionBee(Mac原生App,免费),它同样支持SDXL。
常见问题
显卡显存不足怎么办?
- 报错信息:
RuntimeError: CUDA out of memory或显存不足。解决方案: - 降低图片尺寸:SDXL建议1024x1024,但如果显存只有6GB,改为768x768或512x768。
- 开启“显存优化”选项:在WebUI设置中,
Optimization->Memory attention设为SDP(PyTorch 2.0内置),或勾选Enable Neural Network Speed Up。 - 使用--medvram或--lowvram启动参数:在启动器参数设置中,添加
--medvram(适合6GB),--lowvram(适合4GB)。注意:这些参数会降低生成速度,但能避免崩溃。 - 2026年硬件推荐:最低RTX 3060 12GB,主流RTX 4070 12GB(可流畅生成1080p图片),如果想玩SDXL+ControlNet,建议RTX 4080以上。如果只有集成显卡,直接使用在线版。
常见报错及解决方法
- “No module named 'x'”:缺少Python库。秋叶整合包已包含所有依赖,如果手动安装,用
pip install -r requirements.txt。2026年推荐的Python版本是3.10.12(不要用3.11或3.12,兼容性差)。 - “Model not found”:模型路径错误。检查模型是否在
models/Stable-diffusion文件夹,文件名不能有中文或特殊符号。 - “Black images” 全黑图:大概率是模型损坏或下载不完整。重新下载,并检查文件哈希值(Civitai页面会提供SHA256)。
- “CFG scale too high” 提示:CFG超过30会导致饱和度爆炸,建议控制在15以内。
如何避免“鬼手”和“多指”?
- 原因:Stable Diffusion对手部理解较差,尤其是复杂手势。2026年SD3.5已大幅改善,但仍有问题。
- 解决方案:
- 在负面提示词中加入
bad hands, extra fingers, missing fingers。 - 使用Hand fix Lora(Civitai搜索“hand”),权重0.6-0.8。
- 开启ControlNet Detector的手部检测(DWPose),但需要额外安装。
- 生成后不满意,用局部重绘(Inpaint)涂抹手部,重新生成。
进阶技巧:用ControlNet和Lora实现专业级效果
本部分核心:学会ControlNet,你的Stable Diffusion功力直接提升一个档次,可以媲美Midjourney的高级功能。
ControlNet的四种核心用法
- Canny边缘检测:适合保持线稿轮廓。上传一张图片,ControlNet类型选Canny,权重0.6-0.9,AI会严格按照边缘生成。2026年常用在“线稿上色”场景,先用DeepSeek生成线稿,再导入Canny上色。
- OpenPose姿势控制:适合人物动态。上传一张人物照片,ControlNet自动提取骨骼点,再输入提示词“running”,AI会生成同姿势的跑步人物。注意:OpenPose不识别手指,需要配合手部检测。
- Depth深度图:适合场景构图。上传一张空间照片,AI会保持远近关系,适合室内设计、建筑透视。
- IP-Adapter:2025年新出现的风格迁移工具,可以像Midjourney的“垫图”一样,将一张图片的风格应用到另一张上。2026年IP-Adapter v2.0已支持多图参考。
Lora的叠加使用技巧
- 多Lora叠加:最多可以同时加载5个Lora,但权重总和最好不超过1.5,否则画面混乱。例如,
lora:anime_style:0.7+lora:detailed_face:0.5。 - Lora训练:如果你想生成自己的专属风格(比如“我的自拍风格”),可以训练自己的Lora。2026年训练工具推荐Kohya_SS(版本0.8.0),需要20张高质量图片,训练15分钟即可。门槛比之前低很多,但需要显卡8GB以上。
- 注意:Lora必须与基础模型匹配。SDXL的Lora不能用于SD3.5,反之亦然。下载时注意看标题标注。
读完文章了?试试提效录自建工具
全部免费 · 无需登录 · 打开即用