Conceptos básicos del aprendizaje por refuerzo
Agente, entorno, recompensas y penalizaciones
Conceptos básicos del aprendizaje por refuerzo es una lección gratuita de Python Academy en CoddyKit. Esta es la lección 1 de 5. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Python Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Python Academy incluye 5 lecciones en total.
¿Qué es el aprendizaje por refuerzo?
Conceptos básicos del aprendizaje por refuerzo
El aprendizaje por refuerzo (RL) es un tipo de aprendizaje automático en el que un agente aprende a tomar decisiones al interactuar con un entorno. El objetivo es maximizar las recompensas a lo largo del tiempo.
Entre los componentes clave del RL se incluyen los agentes, los entornos, las recompensas y las penalizaciones.

Terminología clave del RL
Terminología clave del RL
Estos son algunos términos importantes del aprendizaje por refuerzo:
- Agente: Entidad encargada de tomar decisiones (p. ej., un robot o un programa).
- Entorno: Sistema con el que interactúa el agente.
- Estado: Situación actual del entorno.
- Acción: Decisión que toma el agente.
- Recompensa: Respuesta del entorno ante una acción.
Interacción entre el agente y el entorno
Interacción entre el agente y el entorno
La interacción entre el agente y el entorno se puede resumir de la siguiente manera:
- El agente observa el estado actual del entorno.
- El agente lleva a cabo una acción basándose en una política.
- El entorno pasa a un estado nuevo y proporciona una recompensa.
Este ciclo continúa hasta alcanzar un estado terminal.
Recompensas y penalizaciones
Recompensas y penalizaciones
Las recompensas son las respuestas que recibe el agente por sus acciones. El objetivo es maximizar la recompensa acumulada a lo largo del tiempo. Las penalizaciones son recompensas negativas que desincentivan las acciones no deseadas.
Por ejemplo:
- Recompensa: +10 por alcanzar un objetivo.
- Penalización: -5 por chocar con un obstáculo.
Políticas en el RL
Políticas en el RL
Una política es una estrategia que utiliza el agente para decidir las acciones basándose en el estado actual.
Tipos de políticas:
- Determinista: Siempre selecciona la misma acción para un estado determinado.
- Estocástica: Selecciona acciones de forma probabilística.
Exploración frente a explotación
Exploración frente a explotación
El agente debe encontrar un equilibrio entre:
- Exploración: Probar acciones nuevas para obtener más información sobre el entorno.
- Explotación: Elegir las acciones que producen la recompensa más alta conocida.
Equilibrar ambos aspectos es fundamental para lograr un aprendizaje eficaz.
Proceso de decisión de Markov (MDP)
Proceso de decisión de Markov (MDP)
Los problemas de aprendizaje por refuerzo suelen modelarse como un MDP, que se define mediante:
- Estados (S): Posibles configuraciones del entorno.
- Acciones (A): Opciones disponibles para el agente.
- Recompensas (R): Respuestas ante las acciones.
- Probabilidades de transición (P): Probabilidad de pasar de un estado a otro.
Desafíos del aprendizaje por refuerzo
Desafíos del aprendizaje por refuerzo
El aprendizaje por refuerzo presenta algunos desafíos:
- Recompensas retrasadas: Las recompensas pueden recibirse después de varias acciones.
- Recompensas escasas: Las recompensas pueden producirse con poca frecuencia.
- Alta dimensionalidad: Entornos complejos con muchos estados y acciones.
Resumen y próximos pasos
Resumen y próximos pasos
En esta lección:
- Exploramos los conceptos básicos del aprendizaje por refuerzo, incluidos los agentes, los entornos y las recompensas.
- Analizamos las políticas, la exploración frente a la explotación y los MDP.
- Aprendimos sobre los desafíos del RL.
A continuación, profundizaremos en el concepto de tabla Q, un enfoque fundamental del aprendizaje por refuerzo.

Preguntas frecuentes
¿La lección «Conceptos básicos del aprendizaje por refuerzo» es gratis?
Sí — el texto completo de «Conceptos básicos del aprendizaje por refuerzo» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Python Academy, actualiza a CoddyKit PRO. El curso de Python Academy incluye 5 lecciones en total.
¿Qué aprenderé en «Conceptos básicos del aprendizaje por refuerzo»?
Agente, entorno, recompensas y penalizaciones Practicas Python Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Python Academy?
No se requiere experiencia previa. Python Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 5.
¿Cuánto tiempo toma la lección «Conceptos básicos del aprendizaje por refuerzo»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Python Academy?
Sí. Cada lección de Python Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Conceptos básicos del aprendizaje por refuerzo
- Concepto de tabla Q
- Implementación de la tabla Q en Python
- Aprendizaje Q profundo
- Exploración de OpenAI Gym