Назад в блог

Обратный процесс: Извлечение туши из воды

24 августа 2026 г. · 3 мин чтения
Обратный процесс: Извлечение туши из воды - Как диффузионные модели создают шедевры, осторожно извлекая хаос шаг за шагом.

Мы видели, как маг воды уничтожил прекрасный рисунок дракона, осторожно капая черную тушь в воду, по одной капле за раз, пока чаша не стала совершенно темной и хаотичной.

Теперь он раскрывает истинную цель своей магии. Он берет совершенно новую чашу, наполненную исключительно черной, хаотичной тушью с водой. На дне нет никакой спрятанной картины. Это просто чистый шум.

Он опускает в темную воду волшебную кисть. Поскольку он потратил так много времени на изучение того, как именно тушь растекается и разрушает изображение, его волшебная кисть точно знает, как сделать обратное. Точным взмахом кисти он извлекает из воды одну каплю черной туши.

Вода становится чуть светлее. Он снова взмахивает кистью, убирая еще одну каплю туши. И еще одну.

Медленно, шаг за шагом, тьма рассеивается. По мере того как вода светлеет, на дне чаши начинают проступать очертания. Оборачивая вспять точные шаги разрушения, маг вытягивает хаос из воды, оставляя после себя идеально четкий, совершенно новый рисунок дракона, которого никогда раньше не существовало.


Реальность

В диффузионных моделях это называется «Обратным процессом диффузии» (Reverse Diffusion Process) или «Шумоподавлением» (Denoising).

ИИ начинает с холста, заполненного чистым, случайным гауссовским шумом (помехами). Он не рисует изображение поверх шума; вместо этого он смотрит на шум и спрашивает: «Если бы это было изображение, к которому кто-то добавил крошечную каплю шума, как бы выглядел этот шум?»

ИИ математически предсказывает точную форму этой крошечной капли шума и вычитает ее из холста. Изображение становится чуть менее зашумленным. Он повторяет это предсказание и вычитание сотни раз. Шаг за шагом он вытягивает шум из помех, пока не появится совершенно новое, идеально четкое изображение.

Почему это важно

Это пошаговое вычитание шума — причина, по которой диффузионные модели настолько стабильны и мощны по сравнению со старыми моделями, такими как GAN. GAN пытается сгенерировать идеальное изображение за одну-единственную, рискованную попытку. Диффузионной модели не нужно делать все правильно с первого раза. Ей просто нужно делать одно крошечное, выполнимое исправление за раз, медленно вылепливая изображение из шума.

Главная мысль

Гораздо проще создать шедевр, внеся сотню крошечных исправлений, чем пытаться сделать все идеально с первой попытки.


Специалисты по ИИ называют это: Обратный процесс диффузии / Шумоподавление (Reverse Diffusion Process)
Обратный процесс — это параметризованная марковская цепь (обычно нейросеть архитектуры U-Net), обученная инвертировать прямой процесс. Начиная с чистого шума x_T ~ N(0, I), сеть предсказывает и вычитает шум, добавленный на каждом шаге, двигаясь в обратном направлении от t = T к t = 0. Изучая условную вероятность p_θ(x_{t-1} | x_t), модель итеративно очищает скрытую переменную от шума, преобразуя простое гауссовское распределение в сложное целевое распределение данных.

💬 Писали ли вы когда-нибудь первый черновик, который был полным мусором, но в итоге шаг за шагом отредактировали его во что-то великолепное?

Часть 11 из 14 | #GenerativeModelsForHumans
#ai_edu На основе лекций Стэнфорда и индустрии

Есть проект на прицеле?

Давайте обсудим, как мы можем помочь.

Есть идея проекта? →