Основные понятия обучения с подкреплением
Агент, среда, вознаграждения и штрафы
«Основные понятия обучения с подкреплением» — бесплатный урок Python Academy на CoddyKit. Это урок 1 из 5. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Python Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Python Academy содержит 5 уроков всего.
Что такое обучение с подкреплением
Основные понятия обучения с подкреплением
Обучение с подкреплением (RL) — это разновидность машинного обучения, в которой агент учится принимать решения, взаимодействуя со средой. Цель заключается в максимизации вознаграждений с течением времени.
К основным компонентам RL относятся агенты, среды, вознаграждения и штрафы.

Основные термины в RL
Основные термины в RL
Важные термины обучения с подкреплением:
- Агент: тот, кто принимает решения, например робот или программа.
- Среда: система, с которой взаимодействует агент.
- Состояние: текущая ситуация в среде.
- Действие: решение, принятое агентом.
- Вознаграждение: обратная связь от среды за действие.
Взаимодействие агента и среды
Взаимодействие агента и среды
Взаимодействие агента и среды можно обобщить следующим образом:
- Агент наблюдает текущее состояние среды.
- Агент выполняет действие на основе политики.
- Среда переходит в новое состояние и предоставляет вознаграждение.
Этот цикл продолжается до достижения конечного состояния.
Вознаграждения и штрафы
Вознаграждения и штрафы
Вознаграждения — это обратная связь, которую агент получает за свои действия. Цель заключается в максимизации суммарного вознаграждения с течением времени. Штрафы — это отрицательные вознаграждения, которые препятствуют нежелательным действиям.
Например:
- Вознаграждение: +10 за достижение цели.
- Штраф: -5 за столкновение с препятствием.
Политики в RL
Политики в RL
Политика — это стратегия, которую агент использует для выбора действий на основе текущего состояния.
Типы политик:
- Детерминированная: всегда выбирает одно и то же действие для заданного состояния.
- Стохастическая: выбирает действия вероятностным образом.
Исследование и использование
Исследование и использование
Агенту приходится искать компромисс между:
- Исследованием: опробованием новых действий, чтобы больше узнать о среде.
- Использованием: выбором действий, которые обеспечивают наибольшее из известных вознаграждений.
Баланс между этими подходами крайне важен для эффективного обучения.
Марковский процесс принятия решений (MDP)
Марковский процесс принятия решений (MDP)
Задачи обучения с подкреплением часто моделируются как MDP, который определяется следующими компонентами:
- Состояния (S): возможные конфигурации среды.
- Действия (A): доступные агенту варианты выбора.
- Вознаграждения (R): обратная связь за действия.
- Вероятности переходов (P): вероятность перемещения между состояниями.
Проблемы обучения с подкреплением
Проблемы обучения с подкреплением
Обучение с подкреплением связано с некоторыми проблемами:
- Отложенные вознаграждения: вознаграждения могут поступать после нескольких действий.
- Разреженные вознаграждения: вознаграждения могут возникать редко.
- Высокая размерность: сложные среды с большим количеством состояний и действий.
Итоги и дальнейшие шаги
Итоги и дальнейшие шаги
В этом уроке мы:
- изучили основные понятия обучения с подкреплением, включая агентов, среды и вознаграждения;
- обсудили политики, исследование и использование, а также MDP;
- узнали о проблемах RL.
Далее мы подробно рассмотрим концепцию Q-таблицы — фундаментальный подход к обучению с подкреплением.

Часто задаваемые вопросы
Урок «Основные понятия обучения с подкреплением» бесплатный?
Да — полный текст урока «Основные понятия обучения с подкреплением» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Python Academy, подпишись на CoddyKit PRO. Курс Python Academy содержит 5 уроков всего.
Чему я научусь в уроке «Основные понятия обучения с подкреплением»?
Агент, среда, вознаграждения и штрафы Ты практикуешь Python Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Python Academy?
Предыдущий опыт не требуется. Python Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 5.
Сколько времени занимает урок «Основные понятия обучения с подкреплением»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Python Academy?
Да. Каждый урок Python Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Основные понятия обучения с подкреплением
- Понятие Q-таблицы
- Реализация Q-таблицы в Python
- Глубокое Q-обучение
- Знакомство с OpenAI Gym