Stable Diffusion WebUI:最经典的 SD 图形化前端

提起本地跑 Stable Diffusion,绕不开 AUTOMATIC1111 这套 WebUI。它由开发者 A1111 发起,是目前用户量最大、生态最完整的开源 SD 图形化前端,社区里通常直接用 “A1111” 来代指这个项目。对刚入门 SD、想从本地开始折腾的人来说,它几乎是默认的第一站。

下面从它能做什么、怎么装、扩展生态、与同类工具的关系这几个角度,做一个相对完整的梳理。


它是什么、解决了什么

Stable Diffusion 本身只是一套扩散模型,原本的代码仓库对普通用户并不友好——要在命令行里配置环境、写参数,再调用 Python 脚本去跑图。WebUI 的核心价值,就是把整套流程包成一个开箱即用的 Gradio 网页界面,让生成图片变成”打开浏览器、填表、等出图”的事情。

它在 GitHub 上以 AGPL 协议开源,由社区持续维护,文档、wiki、插件市场都相当成熟。即使在 ComfyUI、Fooocus、SD.Next 等新前端不断出现的今天,A1111 仍然是绝大多数教程、模型发布页、插件作者默认的兼容目标。

核心功能一览

根据项目 README 整理,A1111 提供的能力覆盖面非常广:

  • 基础生成:txt2img 文生图、img2img 图生图,两大主 Tab 覆盖最常见用法。
  • 局部重绘(Inpainting):在原图上蒙版指定区域,让模型只重绘这一块,常用于修手、修脸、换装。
  • 外扩(Outpainting):把画面边界往外延伸,可以一张图越扩越大。
  • 提示词机制:支持 negative prompt(负向提示)、clip skip、attention 加权(例如 ((tuxedo))(tuxedo:1.21)),还可以用 Ctrl+Up/Down 在选中的词上快捷调整权重。
  • 采样器与噪声调节:内置多种 sampler,可以调节 eta 噪声系数,也支持更细的噪声设置。
  • 批量与参数:可设 batch count / size,结果自动按种子收齐;生成参数会写进 PNG 的元数据块里,丢回 PNG Info 标签页就能一键还原整套参数。
  • Extras 标签页:内置 GFPGAN、CodeFormer(修脸)、RealESRGAN、ESRGAN、SwinIR、Swin2SR、LDSR 等超分/人脸修复模型,是后期处理的集中入口。
  • Checkpoint Merger:把两个或三个模型按比例混合,便于调出混合风格。
  • Img2img Alternative / Cross Attention 控制:在图生图中使用反向欧拉 cross attention 控制,提供另一种风格表现。
  • Highres Fix:一键产出高分辨率图而不出现明显崩坏。
  • Interrupt / 实时预览:可以随时中断生成,进度条里能看到实时缩略图预览。
  • 种子处理:同一 seed 可以复现,也可以做 seed resize、variations(同图微变)。
  • API 和 CLI 参数:WebUI 自带 API,也允许通过 --allow-code 在界面里跑 Python 脚本。

安装方式:哪种适合你

A1111 在 README 里给出了好几种安装路径,覆盖 Windows、Linux、Apple Silicon 和在线服务。这里把主线整理出来,版本号、依赖名以官方 Wiki 为准。

Windows:最省事的两种路径

一种是直接下载官方打包好的 release 包 sd.webui.zip,解压后依次运行 update.batrun.bat 即可,不需要自己配置 Python 环境。

另一种是常规自动安装:

  1. 安装 Python 3.10.6,安装时勾选 “Add Python to PATH”。
  2. 安装 git。
  3. git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git 拉代码。
  4. 双击运行 webui-user.bat用普通管理员权限而非管理员启动

Linux

Debian/Ubuntu 系需要先装 wgetgitpython3python3-venvlibgl1libglib2.0-0 等基础包;RHEL 用 dnf,openSUSE 用 zypper,Arch 用 pacman,具体命令 README 中按发行版列得很细。

如果是较新的系统(比如 Ubuntu 24.04),可能需要额外装 Python 3.10/3.11,并通过环境变量告诉脚本使用哪个 Python:

# 在 webui-user.sh 中
python_cmd="python3.11"

之后 wget 拉取 webui.sh,或者直接 git clone 然后运行 webui.sh,它会自动建虚拟环境并启动。

Apple Silicon 和在线服务

Mac(M 系列芯片)有专用 Wiki 页介绍;只想先体验、不想本地装机的,也可以直接用 Google Colab 等在线服务(README 列了一个在线服务清单 Wiki)。

硬件要求与社区共识

README 提到过有 4GB、甚至 2GB 显存的显卡跑起来的报告,但实际体验不建议照搬最低数字。新手想少踩坑,社区普遍的建议是 NVIDIA 显卡、8GB 显存起步,6GB 能跑但速度和能选的模型都比较受限。显存不够时,软件会部分卸载到内存,导致出图变慢甚至 OOM。

启用 xformers(在启动参数加 --xformers)可以显著提速,但也只对部分显卡型号更友好,遇到兼容性报错时关掉即可。

扩展生态:为什么大家都推荐它

A1111 的扩展市场是它生命力最强的部分。在 WebUI 内置的 Extensions 标签页里,可以直接通过 URL 安装官方收录的插件。常见的几类扩展:

  • 中文汉化类:把界面、提示词建议、错误提示翻译成中文。
  • ControlNet:用线稿、深度图、姿态等结构信息引导出图,是 A1111 生态里使用频率最高的扩展之一。
  • ADetailer:自动检测并重绘脸/手,缓解 SD 常见的人物崩坏。
  • 提示词补全 / 翻译:输入中文自动补可能的英文 tag,或反之。
  • History Browser:在 WebUI 内浏览、搜索、删除历史出图。
  • Aesthetic Gradients 等美学控制:通过 CLIP embeds 控制整体观感。

加上 README 里提到的 Hypernetwork、LoRA、Embedding 训练,第三方围绕这个前端构建的生态非常厚。新功能往往先以扩展形式登陆 A1111,再慢慢沉淀到主分支。

模型支持:LoRA、Embedding、Hypernetwork

A1111 把这三类额外权重整合得很顺手:

  • LoRA / Hypernetwork:可以从一个独立的小卡片中选择,按提示词插入模型。
  • Embedding(Textual Inversion):自定义的”新词”,可以让基础模型学会特定画风、角色或概念。
  • VAE 切换:在 Settings 页面里换不同的 VAE 来微调颜色与细节。
  • safetensors 格式:原生支持,加载更快也更安全。

主仓库除了稳定版 Stable Diffusion,也支持 SD 2.0、Alt-Diffusion、Segmind SSD-1B 以及 RunwayML 提供的 inpainting 专用模型。具体的模型放置路径、命名规范建议以 Wiki 为准,因为路径规则经常更新。

A1111 vs ComfyUI:两条不同的路

同样在本地跑 SD 的玩家,最近常被问到 A1111 和 ComfyUI 怎么选。两者都不是另一个的替代品,而是两种思路:

  • A1111(WebUI):表单式操作,所有参数摆在界面上,扩展开箱即用,教程多,对新手的认知负担更小。代价是复杂流程要靠插件和参数堆,不太容易做”流水线”。
  • ComfyUI:节点式工作流,每个步骤是一个节点,连起来就是一张流水线。复杂任务(多模型串联、ControlNet 链式、批量化预处理等)非常灵活,但入门曲线明显更陡。

简单的画像:刚开始接触 SD、希望快速出图、想用现成扩展,就选 A1111;如果打算长期深入、玩流水线、或者做工程化的生成任务,可以从 ComfyUI 开始,或者两者都装、互为补充。

写在最后

A1111 不一定是最”新”的前端,但它是目前最稳定、社区最完整、学习资料最丰富的那个。它不是一个垄断式的工具——任何时候你都可以把它和 ComfyUI、SD.Next、Fooocus 装在同一台机器上,按需切换。对想入门本地 SD 的人,把它装起来跑几张图,几乎是这个领域的”必经一站”。至于要不要一直用它,可以等熟悉之后再决定。

附录:具体demo见:https://github.com/AUTOMATIC1111/stable-diffusion-webui/wiki/Features

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。