Как работает нейросеть, которая рисует картинки
Нейросеть генерирует картинку не «рисуя» её слева направо, а постепенно проявляя из случайного шума: за несколько десятков шагов модель убирает шум, на каждом шаге сверяясь с вашим текстовым описанием. Этот процесс называется диффузией — подробное определение есть в глоссарии про диффузию, а здесь объясним его наглядно и без формул.
Понимание механики — не академический интерес: оно напрямую объясняет, почему одни промпты работают, а другие нет.
Обучение наоборот: сначала портим, потом чиним
Диффузионную модель учат в два движения. Сначала берут миллионы настоящих изображений с текстовыми описаниями и постепенно «портят» их, добавляя шум шаг за шагом, пока от картинки не останется телевизионная рябь. Затем нейросеть учат обратному фокусу: смотреть на зашумлённую версию и предсказывать, как выглядел кадр на шаг чище.
Ключевой момент: модель не запоминает картинки из обучающей выборки. Она выучивает закономерности — как выглядят тени, как строится перспектива, как шерсть отличается от травы. Поэтому она способна нарисовать «кота-космонавта в стиле акварели», которого никогда не видела: закономерности «кот», «скафандр» и «акварель» она знает по отдельности и умеет совмещать.
Генерация: от ряби к изображению за 20-50 шагов
Когда вы отправляете промпт, происходит следующее:
- Модель создаёт кадр чистого случайного шума — стартовую «рябь».
- Текст промпта преобразуется в числовое представление смысла — оно будет компасом на каждом шаге.
- Шаг за шагом (обычно 20-50 итераций) модель убирает часть шума, каждый раз спрашивая себя: «какая картинка, соответствующая этому описанию, могла бы скрываться под этим шумом?»
- На ранних шагах проявляется композиция и крупные формы, на средних — объекты и цвета, на последних — мелкие детали и текстуры.
Отсюда и характер ошибок генерации: общая сцена почти всегда осмысленна (она решается на ранних шагах), а мелочи вроде пальцев или букв — самое хрупкое (они дорисовываются в конце).
Что это знание даёт для промптов
Из механики диффузии следуют практические правила:
| Особенность процесса | Вывод для промпта |
|---|---|
| Композиция решается первой | Главный объект и план сцены — в начало промпта |
| Текст — компас на каждом шаге | Конкретика («мягкий закатный свет») работает лучше оценок («красиво») |
| Каждая генерация стартует с нового шума | Один промпт — разные результаты; генерируйте вариантами |
| Детали — самое хрупкое | Мелкий текст и руки проверяйте отдельно, правьте редактированием |
Разные модели — это по сути разная «начитанность» и разный бюджет вычислений на те же шаги: поэтому лёгкая Z-Image стоит 1 ₽ за изображение, а флагманская Google Nano Banana Pro — 30 ₽. Механика у них общая, отличается качество проявления деталей.
Диффузия — лишь одно из семейств генеративного ИИ: тексты генерируются иначе, предсказанием следующего токена, но принцип «модель выучивает закономерности, а не копирует примеры» общий для всех.
Попробовать и увидеть процесс своими глазами
Лучший способ понять диффузию — сгенерировать серию картинок по одному промпту и посмотреть, что меняется. На странице генерации изображений доступны десять моделей от 1 ₽ за картинку; welcome-бонус 50 ₽ новичку на ГПТ Россия позволяет провести такой эксперимент бесплатно — без VPN, с оплатой российской картой в дальнейшем.
Частые вопросы
Почему по одному промпту получаются разные картинки?
Каждая генерация начинается с нового случайного шума — стартовая точка всякий раз другая, поэтому и «проявляется» из неё другое изображение. Это свойство, а не баг: генерируйте несколько вариантов и выбирайте лучший.
Нейросеть копирует картинки из интернета?
Нет. В модели не хранятся исходные изображения — только выученные закономерности: как устроен свет, формы, стили. Именно поэтому она рисует сцены, которых не существует, комбинируя знакомые понятия.
Почему у нейросетей проблемы с пальцами и надписями?
Мелкие детали проявляются на последних шагах диффузии и требуют точной согласованности крошечных элементов — это самая хрупкая часть процесса. Современные флагманы справляются заметно лучше, а огрехи проще исправить режимом редактирования той же модели.



