Назад в блог

Обучение с учителем и обучение с подкреплением: Боевое крещение

17 сентября 2026 г. · 3 мин чтения
Обучение с учителем и обучение с подкреплением: Боевое крещение - Почему заучивание чужих ответов не работает в динамичных играх, и почему настоящий интеллект рождается только через последствия своих решений.

Новичок в киберспорте сидит в звукоизолированной кабине турнира, судорожно листая 500-страничный гайд. Он вызубрил все классические дебюты, стандартные контр-пики и проверенные тайминги из пятилетнего архива финалов чемпионатов мира.

Но уже на третьей минуте матча его опытный соперник делает безумный, нестандартный фланговый маневр, которого никогда не было ни в одном турнирном реплее.

Новичок впадает в ступор. Этого мува нет в методичке. У него нет заранее заготовленного «правильного ответа». Через тридцать секунд его база разлетается в щепки.

На противоположной стороне сцены ветеран не зубрила чужие гайды. Она училась играть, откатав десять тысяч беспощадных каток. Она проигрывала тысячи раундов, пробовала странные связки, на собственной шкуре прочувствовала цену каждой ошибки и нашла победные стратегии, о которых не напишут ни в одном учебнике.


Реальность

Большинство систем искусственного интеллекта, с которыми вы сталкиваетесь, обучаются с учителем (Supervised Learning). Человек-разработчик дает модели миллионы подписанных примеров: «Вот фотография, правильный ответ — Кот. Вот письмо, правильный ответ — Спам». Модель учится, просто запоминая и сопоставляя паттерны.

Обучение с учителем отлично работает, пока у вас есть четкая разметка. Но в сложных, динамичных задачах — будь то шахматы, StarCraft, автопилот на загруженном перекрестке или переговоры — рядом нет учителя, который подскажет идеальное действие для каждой доли секунды.

Здесь в игру вступает Обучение с подкреплением (Reinforcement Learning, RL).

В RL нет учителя и нет датасета с правильными ответами. Модель просто бросают на цифровую арену с понятной целью (выиграть матч, удержать машину на трассе, набрать максимум очков) и набором кнопок управления. Она делает ход, видит последствия, получает награду (очки) или штраф (урон) и шаг за шагом нащупывает победную стратегию через пробы, ошибки и последствия.

Почему это важно

Обучение с учителем учит ИИ повторять прошлое. Обучение с подкреплением учит ИИ изобретать будущее. Именно благодаря RL программа AlphaGo смогла сделать легендарный «Ход 37» — ход, который ни один человек не сделал за 3000 лет истории игры Го, потому что нейросеть не копировала людей, а училась побеждать.

Главная мысль

Заучивание чужих ответов учит вас копировать; проживание собственных ошибок учит вас побеждать.


Специалисты по ИИ называют это: Обучение с учителем против марковских процессов принятия решений (MDP) / Обучение с подкреплением (Reinforcement Learning)
Обучение с учителем оптимизирует функцию потерь относительно эталонных меток y при входе x (L(f(x), y)). Обучение с подкреплением оптимизирует стратегию поведения π(a|s), максимизируя ожидаемую накопленную будущую награду E[Σ γ^t r_t] через прямое взаимодействие со средой без пошаговой разметки.

💬 Пытались ли вы когда-нибудь освоить сложный навык по книгам, а потом поняли, что реальный прогресс пошел только после первых шишек на практике?

Часть 1 из 15 | #ReinforcementLearningForHumans
#ai_edu На основе лекций Стэнфорда и индустрии

Есть проект на прицеле?

Давайте обсудим, как мы можем помочь.

Есть идея проекта? →