Как работает нейросеть, которая рисует картинки

Нейросеть генерирует картинку не «рисуя» её слева направо, а постепенно проявляя из случайного шума: за несколько десятков шагов модель убирает шум, на каждом шаге сверяясь с вашим текстовым описанием. Этот процесс называется диффузией — подробное определение есть в глоссарии про диффузию, а здесь объясним его наглядно и без формул.

Понимание механики — не академический интерес: оно напрямую объясняет, почему одни промпты работают, а другие нет.

Обучение наоборот: сначала портим, потом чиним

Диффузионную модель учат в два движения. Сначала берут миллионы настоящих изображений с текстовыми описаниями и постепенно «портят» их, добавляя шум шаг за шагом, пока от картинки не останется телевизионная рябь. Затем нейросеть учат обратному фокусу: смотреть на зашумлённую версию и предсказывать, как выглядел кадр на шаг чище.

Ключевой момент: модель не запоминает картинки из обучающей выборки. Она выучивает закономерности — как выглядят тени, как строится перспектива, как шерсть отличается от травы. Поэтому она способна нарисовать «кота-космонавта в стиле акварели», которого никогда не видела: закономерности «кот», «скафандр» и «акварель» она знает по отдельности и умеет совмещать.

Генерация: от ряби к изображению за 20-50 шагов

Когда вы отправляете промпт, происходит следующее:

  1. Модель создаёт кадр чистого случайного шума — стартовую «рябь».
  2. Текст промпта преобразуется в числовое представление смысла — оно будет компасом на каждом шаге.
  3. Шаг за шагом (обычно 20-50 итераций) модель убирает часть шума, каждый раз спрашивая себя: «какая картинка, соответствующая этому описанию, могла бы скрываться под этим шумом?»
  4. На ранних шагах проявляется композиция и крупные формы, на средних — объекты и цвета, на последних — мелкие детали и текстуры.

Отсюда и характер ошибок генерации: общая сцена почти всегда осмысленна (она решается на ранних шагах), а мелочи вроде пальцев или букв — самое хрупкое (они дорисовываются в конце).

Что это знание даёт для промптов

Из механики диффузии следуют практические правила:

Особенность процессаВывод для промпта
Композиция решается первойГлавный объект и план сцены — в начало промпта
Текст — компас на каждом шагеКонкретика («мягкий закатный свет») работает лучше оценок («красиво»)
Каждая генерация стартует с нового шумаОдин промпт — разные результаты; генерируйте вариантами
Детали — самое хрупкоеМелкий текст и руки проверяйте отдельно, правьте редактированием

Разные модели — это по сути разная «начитанность» и разный бюджет вычислений на те же шаги: поэтому лёгкая Z-Image стоит 1 ₽ за изображение, а флагманская Google Nano Banana Pro — 30 ₽. Механика у них общая, отличается качество проявления деталей.

Диффузия — лишь одно из семейств генеративного ИИ: тексты генерируются иначе, предсказанием следующего токена, но принцип «модель выучивает закономерности, а не копирует примеры» общий для всех.

Попробовать и увидеть процесс своими глазами

Лучший способ понять диффузию — сгенерировать серию картинок по одному промпту и посмотреть, что меняется. На странице генерации изображений доступны десять моделей от 1 ₽ за картинку; welcome-бонус 50 ₽ новичку на ГПТ Россия позволяет провести такой эксперимент бесплатно — без VPN, с оплатой российской картой в дальнейшем.

Частые вопросы

Почему по одному промпту получаются разные картинки?

Каждая генерация начинается с нового случайного шума — стартовая точка всякий раз другая, поэтому и «проявляется» из неё другое изображение. Это свойство, а не баг: генерируйте несколько вариантов и выбирайте лучший.

Нейросеть копирует картинки из интернета?

Нет. В модели не хранятся исходные изображения — только выученные закономерности: как устроен свет, формы, стили. Именно поэтому она рисует сцены, которых не существует, комбинируя знакомые понятия.

Почему у нейросетей проблемы с пальцами и надписями?

Мелкие детали проявляются на последних шагах диффузии и требуют точной согласованности крошечных элементов — это самая хрупкая часть процесса. Современные флагманы справляются заметно лучше, а огрехи проще исправить режимом редактирования той же модели.