IskraGen

Stable Diffusion: что это, какое железо нужно и чем её заменить

Модели и цены14 сентября 20269 мин чтения
Открытый системный блок с крупной видеокартой в тёмной комнате, подсвеченный фиолетовым
Сгенерировано в IskraGen · gpt-image-2-text-to-image
Промпт

Horizontal blog cover. Scene: a dim home workspace at night, deep near-black background #0A0A0F, soft violet #7C3AFF rim light from the side. Subject: an open PC case in three-quarter view with a large graphics card in the center, cooling fans and heatsink fins clearly visible, a single violet LED strip glowing along the card. Details: matte black metal, dust-free but real hardware texture, thin power cables, shallow depth of field, faint violet reflections on the glass side panel. Composition: 16:9, the graphics card in the lower-left two thirds, clean empty negative space in the upper right. Constraints: absolutely NO text, NO letters, NO logos, NO numbers, NO watermark, no brand names on the card. Use: cover image for an article about running an image model on your own computer. Стиль: тёмный фон #0A0A0F, акцентный фиолетовый #7C3AFF, крупный рубленый шрифт, без водяных знаков.

Главное:

  • Stable Diffusion — не сайт с кнопкой, а модель, которую скачивают и запускают на своём компьютере.
  • Версии 3.5 Large нужна карта на 16–24 ГБ видеопамяти, Medium заявлена на 9,9 ГБ.
  • Интерфейсов три: AUTOMATIC1111 WebUI, Forge и ComfyUI. Все ставятся руками, через Python и git.
  • Локальный запуск окупается при потоке задач и своей мощной карте, разовые картинки проще делать онлайн.
  • В каталоге Искры те же задачи закрывают Flux-2 Pro, Qwen Image 3.0, Seedream 5.0 Pro и Nano Banana 2.

Запрос «stable diffusion» люди задают с очень разными ожиданиями. Одни ищут сайт, где ввести описание и получить картинку. Другие — инструкцию по установке. Третьи — понять, чем эта нейросеть отличается от Midjourney и стоит ли ради неё покупать видеокарту. Разберём всё по порядку: что такое Stable Diffusion, какое железо она требует, через какие программы её открывают и в каких случаях локальный запуск себя не окупает.

Что такое Stable Diffusion простыми словами

Stable Diffusion — открытая модель генерации изображений: её веса выложены публично, а запускает их на своём железе сам пользователь. Никакого единого «официального сайта с кнопкой» у неё нет, есть файл модели и программа, которая этот файл загружает в видеопамять.

Из-за такой схемы Stable Diffusion сильно отличается от привычных онлайн-сервисов. Онлайн-сервис — это чужие серверы: вы платите за генерацию и не думаете о драйверах. Здесь наоборот: компьютер ваш, электричество ваше, ошибки установки тоже ваши. Взамен вы получаете полный контроль над процессом и работу без интернета.

Версий у модели накопилось несколько, и они не заменяют друг друга полностью. Stable Diffusion XL (SDXL) 1.0 устроена как связка из двух частей: базовая модель создаёт черновой результат, а refiner дорабатывает финальные шаги. В ней 3 млрд параметров, распространяется она по лицензии CreativeML Open RAIL++-M.

Следующее поколение вышло в октябре 2024 года. Stable Diffusion 3.5 Large получила 8,1 млрд параметров и рассчитана на картинку размером около мегапикселя. Вместе с ней опубликовали Large Turbo — дистиллированный вариант, который выдаёт результат за четыре шага вместо десятков. Через неделю появилась версия Medium: 2,5 млрд параметров и диапазон от 0,25 до 2 мегапикселей, специально под потребительское железо.

Отдельный вопрос — права на результат. Stable Diffusion 3.5 распространяется по Stability AI Community License: коммерческое использование разрешено, пока годовая выручка компании или человека меньше миллиона долларов. Перешагнули порог — Stability AI просит оформить Enterprise-лицензию. Для блогера или небольшой студии это условие ничего не меняет, для рекламного агентства с крупным оборотом — уже пункт, который читают юристы.

Внутри модель работает не с пикселями напрямую: текст сначала превращают в числовое представление текстовые энкодеры. У версии 3.5 Large их три — два варианта CLIP и T5-xxl. Именно они во многом отвечают за то, насколько точно модель поймёт длинное описание, и именно они дополнительно занимают память при запуске.

Что нужно, чтобы запустить Stable Diffusion локально

Для локального запуска нужны видеокарта на 10–24 ГБ видеопамяти, десятки гигабайт свободного места на диске, Python 3.10.6 и git. Это минимальный набор, без которого дальше двигаться бессмысленно.

Главный ограничитель — видеопамять. Stability AI заявляет для версии Medium 9,9 ГБ без учёта текстовых энкодеров: энкодеры добавят сверху, поэтому карта на 8 ГБ окажется на грани. Для версии Large ориентир выше. Официальная матрица поддержки NVIDIA перечисляет из игровых карт только GeForce RTX 5080 на 16 ГБ, RTX 4090 на 24 ГБ и RTX 5090 на 32 ГБ — всё, что ниже по объёму памяти, в списке отсутствует.

Дальше идёт диск. Каждая версия модели — это отдельный файл весов на несколько гигабайт, и обычно пользователь держит не один, а несколько. Плюс само окружение: Python, PyTorch, библиотеки и кеш. Двадцатью гигабайтами дело редко ограничивается.

Третий пункт — время. Установка AUTOMATIC1111 WebUI на Windows описана в README проекта четырьмя шагами: поставить Python 3.10.6 с галочкой «Add Python to PATH», поставить git, склонировать репозиторий и запустить webui-user.bat. На бумаге это полчаса. На практике добавляются драйверы, несовпадающие версии PyTorch, ошибки с правами и первый запуск, который молча качает пару гигабайт зависимостей.

Требование к версии Python стоит воспринимать буквально: разработчики WebUI прямо указывают 3.10.6 и предупреждают, что более новые версии не поддерживаются torch. Установленный «на всякий случай» Python 3.12 здесь работает против вас.

Карта не обязательно должна быть от NVIDIA. WebUI поддерживает AMD, Intel и Apple Silicon, ComfyUI дополнительно умеет ROCm, Intel Arc и режим на одном процессоре. Но чем дальше от связки NVIDIA + CUDA, тем больше времени уходит на подбор сборки и тем ниже скорость: генерация на процессоре измеряется минутами на картинку, а не секундами.

Если видеопамяти не хватает, есть два законных приёма. Первый — выгрузка частей модели в оперативную память: в карточке SDXL для таких случаев рекомендуют включать cpu offload. Второй — квантование: перевод весов в меньшую разрядность. Перевод из 32 бит в 16 сокращает размер модели вдвое, а для Stable Diffusion 3.5 доступны варианты с квантованием в 4 бита через bitsandbytes. Оба приёма замедляют работу, зато позволяют запуститься там, где иначе была бы ошибка нехватки памяти.

Инфографика с требованиями к железу и окружению для локального запуска: видеопамять, диск, версии Python

Минимальный набор для локального запуска: видеопамять, место на диске и точные версии окружения.

WebUI, Forge и ComfyUI: чем открывают Stable Diffusion

Сама модель — это файл, интерфейс к ней ставится отдельно. Три программы делят рынок: AUTOMATIC1111 WebUI, его форк Forge и нодовый ComfyUI.

AUTOMATIC1111 Stable Diffusion WebUI — исторический стандарт. Браузерное окно с полями промпта, выпадающим списком моделей и вкладками для дорисовки. Вокруг него выросла огромная экосистема расширений. При этом развитие проекта заметно замедлилось: последний релиз v1.10.1 датирован 9 февраля 2025 года, а предшествующий ему v1.10.0 — 27 июля 2024 года. Полтора года без новых версий — срок, за который вышло целое поколение моделей.

Forge — платформа поверх того же WebUI. Авторы описывают задачу так: упростить разработку, оптимизировать управление ресурсами и ускорить инференс. Внешне это тот же интерфейс, к которому привыкли пользователи AUTOMATIC1111, поэтому переход не требует переучивания. Основан Forge на версии SD-WebUI 1.10.1 и синхронизируется с оригиналом примерно раз в 90 дней или когда выходят важные исправления.

ComfyUI устроен принципиально иначе: вместо формы с полями — визуальный граф, где вы соединяете ноды в цепочку. Загрузка модели, текст, сэмплер, сохранение файла — каждый шаг отдельный блок. Порог входа выше, зато готовую схему можно сохранить и переиспользовать, а сложные сценарии собираются без кода. Поддержка моделей у ComfyUI самая широкая: Stable Diffusion 1.5, SDXL, SD 3.5, Flux.1 и Flux.2, а также видеомодели вроде Wan, LTX-Video и HunyuanVideo. Работает он с NVIDIA, AMD ROCm, Intel Arc, Apple Silicon и на процессоре, а с видеопамятью обращается аккуратно: выгружает неиспользуемые части модели и понимает квантованные веса.

Требования к окружению у программ разные, и это ловушка для новичка. WebUI просит Python 3.10.6, ComfyUI рекомендует Python 3.13 и PyTorch не ниже 2.7. Две программы на одной машине спокойно уживаются только в отдельных виртуальных окружениях — иначе установка второй ломает первую.

Модели для Stable Diffusion: версии, веса и квантование

Одна установка работает с разными файлами весов: SDXL, SD 3.5 Medium, SD 3.5 Large и их квантованные варианты подключаются к тому же интерфейсу. Именно поэтому фраза «модели для Stable Diffusion» означает не одну нейросеть, а набор файлов, между которыми переключаются в выпадающем списке.

Разница между версиями практическая, а не косметическая. SDXL 1.0 — это 3 млрд параметров и схема base + refiner, то есть двухступенчатая обработка. Stable Diffusion 3.5 Large — 8,1 млрд параметров и заметно более сильное понимание длинных описаний за счёт трёх текстовых энкодеров. Medium с её 2,5 млрд параметров — компромисс: она рассчитана на диапазон от 0,25 до 2 мегапикселей и на домашние карты. Large Turbo экономит время: четыре шага вместо полного цикла.

Большая модель не всегда лучший выбор. Веса Large занимают больше места и требуют больше видеопамяти, а разница в результате видна не на каждом сюжете. Для быстрых черновиков имеет смысл Medium или Turbo, для финального кадра — Large.

Квантование добавляет ещё одно измерение выбора. Один и тот же файл модели существует в разной разрядности: чем меньше бит на вес, тем меньше расход памяти и тем быстрее расчёты. Для Stable Diffusion 3.5 опубликованы версии с квантованием в 4 бита через bitsandbytes. Цена — потеря части точности, поэтому квантованные веса берут, когда карта не тянет полную модель.

Скорость тоже настраивается. В карточке SDXL разработчики советуют оборачивать unet в torch.compile на PyTorch 2.0 и новее — заявленный выигрыш составляет 20–30 %. Приём требует времени на первую компиляцию, но на длинной серии генераций окупается.

Когда локальный Stable Diffusion оправдан, а когда проще онлайн

Локальный запуск окупается при постоянном потоке картинок и уже купленной мощной карте, а разовые задачи дешевле решать онлайн. Это главный практический вывод всей статьи.

Считайте по трём статьям расхода. Первая — железо: карта уровня RTX 4090 на 24 ГБ стоит как подержанный автомобиль, и покупать её ради десяти картинок в месяц смысла нет. Вторая — время: установка Python, git, WebUI и первых весов занимает вечер у опытного пользователя и выходные у новичка, а дальше добавляется поддержка — обновления, конфликты версий, поиск причин ошибок. Третья — электричество и шум: генерация нагружает карту полностью.

Локальный вариант выигрывает в трёх сценариях. Вам нужен полный контроль над моделью и настройками. Вы работаете с материалом, который не хотите отправлять на чужие серверы. Или вы генерируете сотнями картинок в день, и разница в расходах на дистанции перекрывает стоимость карты.

Онлайн-генерация выигрывает, когда результат нужен сейчас, а разбираться с установкой некогда. В каталоге Искры те же задачи закрывают модели с оплатой за результат: Flux-2 Pro — от 4 ₽ за картинку, Qwen Image 3.0 — от 5 ₽, Seedream 5.0 Pro — от 7 ₽, Nano Banana 2 — от 7 ₽. Списание идёт в рублях, зарубежная карта не нужна, а генерация запускается в браузере без единой установки.

Разница в модели оплаты важнее, чем кажется. Локальный Stable Diffusion требует вложений до первой картинки: сначала купите карту и потратьте время, потом получите результат. Онлайн-модель берёт деньги за готовый кадр — неудачная попытка стоит несколько рублей, а не вечер настройки. Мы подробно сравнивали схемы оплаты в разборе подписки против оплаты за генерацию.

Есть и промежуточный путь. Многие пробуют Stable Diffusion online через чужие веб-сервисы: модель та же, железо арендованное. Минус в том, что вы теряете главное преимущество локального запуска — контроль, — и при этом всё равно платите. Если контроль не нужен, логичнее взять модель, которая изначально сделана как сервис: аналоги Midjourney мы разбирали отдельно, а про редактор картинок от Google писали в материале про Nano Banana.

Итог простой. Stable Diffusion — мощный инструмент для тех, кто готов вложиться в железо и разобраться в настройках. Для всех остальных быстрее и спокойнее платить за готовые кадры онлайн и тратить время на сам результат, а не на подбор версии PyTorch.

Инфографика со сравнением локального запуска и онлайн-генерации с ценами моделей каталога

Локальный запуск против онлайн-генерации: за что вы платите в каждом случае.

Частые вопросы

Попробовать Flux-2 - Pro Text to Image в IskraGen

Генерация без VPN, оплата в рублях через СБП. Первые генерации — за минуту.

Похожие статьи