Обучение с учителем и обучение с подкреплением: Боевое крещение
Новичок в киберспорте сидит в звукоизолированной кабине турнира, судорожно листая 500-страничный гайд. Он вызубрил все классические дебюты, стандартные контр-пики и проверенные тайминги из пятилетнего архива финалов чемпионатов мира.
Но уже на третьей минуте матча его опытный соперник делает безумный, нестандартный фланговый маневр, которого никогда не было ни в одном турнирном реплее.
Новичок впадает в ступор. Этого мува нет в методичке. У него нет заранее заготовленного «правильного ответа». Через тридцать секунд его база разлетается в щепки.
На противоположной стороне сцены ветеран не зубрила чужие гайды. Она училась играть, откатав десять тысяч беспощадных каток. Она проигрывала тысячи раундов, пробовала странные связки, на собственной шкуре прочувствовала цену каждой ошибки и нашла победные стратегии, о которых не напишут ни в одном учебнике.
Реальность
Большинство систем искусственного интеллекта, с которыми вы сталкиваетесь, обучаются с учителем (Supervised Learning). Человек-разработчик дает модели миллионы подписанных примеров: «Вот фотография, правильный ответ — Кот. Вот письмо, правильный ответ — Спам». Модель учится, просто запоминая и сопоставляя паттерны.
Обучение с учителем отлично работает, пока у вас есть четкая разметка. Но в сложных, динамичных задачах — будь то шахматы, StarCraft, автопилот на загруженном перекрестке или переговоры — рядом нет учителя, который подскажет идеальное действие для каждой доли секунды.
Здесь в игру вступает Обучение с подкреплением (Reinforcement Learning, RL).
В RL нет учителя и нет датасета с правильными ответами. Модель просто бросают на цифровую арену с понятной целью (выиграть матч, удержать машину на трассе, набрать максимум очков) и набором кнопок управления. Она делает ход, видит последствия, получает награду (очки) или штраф (урон) и шаг за шагом нащупывает победную стратегию через пробы, ошибки и последствия.
Почему это важно
Обучение с учителем учит ИИ повторять прошлое. Обучение с подкреплением учит ИИ изобретать будущее. Именно благодаря RL программа AlphaGo смогла сделать легендарный «Ход 37» — ход, который ни один человек не сделал за 3000 лет истории игры Го, потому что нейросеть не копировала людей, а училась побеждать.
Главная мысль
Заучивание чужих ответов учит вас копировать; проживание собственных ошибок учит вас побеждать.
Специалисты по ИИ называют это: Обучение с учителем против марковских процессов принятия решений (MDP) / Обучение с подкреплением (Reinforcement Learning)
Обучение с учителем оптимизирует функцию потерь относительно эталонных меток y при входе x (L(f(x), y)). Обучение с подкреплением оптимизирует стратегию поведения π(a|s), максимизируя ожидаемую накопленную будущую награду E[Σ γ^t r_t] через прямое взаимодействие со средой без пошаговой разметки.
💬 Пытались ли вы когда-нибудь освоить сложный навык по книгам, а потом поняли, что реальный прогресс пошел только после первых шишек на практике?
Часть 1 из 15 | #ReinforcementLearningForHumans
#ai_edu На основе лекций Стэнфорда и индустрии