Назад в блог

Ненасыщающаяся функция потерь: Изменение правил

19 августа 2026 г. · 3 мин чтения
Ненасыщающаяся функция потерь: Изменение правил - Почему ИИ нуждается в самой сильной обратной связи именно тогда, когда он терпит полное поражение, и математический трюк, который делает это возможным.

В начале дуэли фальсификатор ужасен. Его картины выглядят как хаотичные брызги туши. Инспектор ловит его каждый раз.

Если правила сёгуна гласят: «Ты получаешь награду только в зависимости от того, насколько близок к обману инспектора», то фальсификатор в беде. Когда его работа абсолютно ужасна, он на 0% близок к обману инспектора. Оценка, которую он получает — ноль. Без единой подсказки, как стать лучше, он деморализуется и перестает учиться. Он застревает на дне.

Чтобы это исправить, мастер игры меняет правила. Новое правило гласит: «Вместо того чтобы беспокоиться о том, насколько ты близок к победе, сосредоточься исключительно на том, как часто инспектор ошибается».

Когда фальсификатор ужасен, инспектор не ошибается никогда. Но сместив фокус, мы добиваемся того, что самые первые, микроскопические улучшения фальсификатора вдруг дают огромный сигнал для обучения. Когда его рисунки хуже всего, новые правила гарантируют, что он получает самую сильную обратную связь о том, что именно пошло не так, давая ему мощный толчок, необходимый для улучшения.


Реальность

В ИИ это представляет собой важнейшее математическое исправление, называемое «ненасыщающейся функцией потерь» (Non-Saturating Cost Function).

Когда мы обучаем GAN с помощью стандартной минимаксной игры, Генератор в начале обучения страдает от «затухания градиентов» (vanishing gradients). Если Дискриминатор намного лучше Генератора (что верно в начале, так как Генератор выдает только случайный шум), функция потерь Генератора становится плоской (она «насыщается»). ИИ не учится абсолютно ничему.

Чтобы это исправить, мы меняем математическую цель. Вместо того чтобы говорить Генератору минимизировать вероятность того, что Дискриминатор прав, мы говорим Генератору максимизировать вероятность того, что Дискриминатор ошибается.

Почему это важно

Математически эти две цели кажутся идентичными. Но в ландшафте матанализа и градиентного спуска они выглядят совершенно по-разному. Благодаря этой простой замене в уравнении Генератор получает колоссальный сигнал для обучения (крутые градиенты) именно тогда, когда его данные хуже всего. Это тот самый математический трюк, который позволяет запустить обучение GAN и не дает ему провалиться на ранних этапах.

Главная мысль

Когда кто-то терпит полное поражение, ему нужна не нулевая оценка, а самая сильная и подробная обратная связь о том, как стать лучше.


Специалисты по ИИ называют это: Ненасыщающаяся функция потерь (трюк Log D)
Чтобы предотвратить затухание градиентов на ранних этапах обучения, когда Дискриминатор доминирует, цель Генератора изменяется. Вместо того чтобы минимизировать log(1 - D(G(z))), он максимизирует log(D(G(z))), обеспечивая сильные градиенты и значительные обновления параметров, когда сгенерированные образцы плохого качества.

💬 Пытались ли вы когда-нибудь освоить сложный новый навык, но бросили на раннем этапе, потому что первоначальная обратная связь была слишком суровой и непонятной?

Часть 8 из 14 | #GenerativeModelsForHumans
#ai_edu На основе лекций Стэнфорда и индустрии

Есть проект на прицеле?

Давайте обсудим, как мы можем помочь.

Есть идея проекта? →