Conceitos básicos de aprendizado por reforço
Agente, ambiente, recompensas e penalidades.
Conceitos básicos de aprendizado por reforço é uma aula grátis de Learn AI with Python no CoddyKit. Esta é a aula 1 de 5. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Learn AI with Python, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Learn AI with Python inclui 5 aulas no total.
O que é a aprendizagem por reforço?
Conceitos básicos da aprendizagem por reforço
A aprendizagem por reforço (RL) é um tipo de aprendizagem de máquina em que um agente aprende a tomar decisões interagindo com um ambiente. O objetivo é maximizar as recompensas ao longo do tempo.
Os principais componentes de RL incluem agentes, ambientes, recompensas e penalidades.

Terminologia essencial do RL
Terminologia essencial do RL
Termos importantes do aprendizado por reforço:
- Agente: O responsável pelas decisões (por exemplo, um robô ou programa).
- Ambiente: O sistema com o qual o agente interage.
- Estado: A situação atual do ambiente.
- Ação: A decisão tomada pelo agente.
- Recompensa: O retorno do ambiente para uma ação.
Interação entre agente e ambiente
Interação entre agente e ambiente
A interação entre o agente e o ambiente pode ser resumida da seguinte forma:
- O agente observa o estado atual do ambiente.
- O agente executa uma ação com base em uma política.
- O ambiente passa para um novo estado e fornece uma recompensa.
Esse ciclo continua até que um estado terminal seja alcançado.
Recompensas e penalidades
Recompensas e penalidades
As recompensas são o retorno fornecido ao agente por suas ações. O objetivo é maximizar a recompensa acumulada ao longo do tempo. As penalidades são recompensas negativas que desestimulam ações indesejáveis.
Por exemplo:
- Recompensa: +10 por alcançar um objetivo.
- Penalidade: -5 por atingir um obstáculo.
Políticas em RL
Políticas em RL
Uma política é uma estratégia usada pelo agente para decidir ações com base no estado atual.
Tipos de políticas:
- Determinística: sempre seleciona a mesma ação para um determinado estado.
- Estocástica: seleciona ações de forma probabilística.
Exploração versus aproveitamento
Exploração versus aproveitamento
O agente precisa equilibrar:
- Exploração: experimentar novas ações para descobrir mais sobre o ambiente.
- Aproveitamento: escolher as ações que produzem a maior recompensa conhecida.
Equilibrar esses dois aspectos é essencial para uma aprendizagem eficaz.
Processo de decisão de Markov (MDP)
Processo de decisão de Markov (MDP)
Os problemas de aprendizagem por reforço costumam ser modelados como um MDP, definido por:
- Estados (S): configurações possíveis do ambiente.
- Ações (A): escolhas disponíveis para o agente.
- Recompensas (R): retorno das ações.
- Probabilidades de transição (P): probabilidade de passar de um estado para outro.
Desafios do aprendizado por reforço
Desafios do aprendizado por reforço
O aprendizado por reforço apresenta alguns desafios:
- Recompensas atrasadas: as recompensas podem ser recebidas após várias ações.
- Recompensas esparsas: as recompensas podem ocorrer com pouca frequência.
- Alta dimensionalidade: ambientes complexos com muitos estados e ações.
Resumo e próximos passos
Resumo e próximos passos
Nesta lição, nós:
- Exploramos os conceitos básicos da aprendizagem por reforço, incluindo agentes, ambientes e recompensas.
- Discutimos políticas, exploração versus aproveitamento e MDPs.
- Aprendemos sobre os desafios de RL.
Em seguida, vamos nos aprofundar no conceito de tabela Q, uma abordagem fundamental da aprendizagem por reforço.

Perguntas Frequentes
A aula “Conceitos básicos de aprendizado por reforço” é grátis?
Sim — o texto completo de “Conceitos básicos de aprendizado por reforço” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Learn AI with Python, atualize para CoddyKit PRO. O curso de Learn AI with Python inclui 5 aulas no total.
O que vou aprender em “Conceitos básicos de aprendizado por reforço”?
Agente, ambiente, recompensas e penalidades. Você pratica Learn AI with Python com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Learn AI with Python?
Nenhuma experiência prévia é necessária. Learn AI with Python no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 5.
Quanto tempo leva a aula “Conceitos básicos de aprendizado por reforço”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Learn AI with Python?
Sim. Cada aula de Learn AI with Python inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Conceitos básicos de aprendizado por reforço
- Conceito de Q-Table
- Implementação de uma tabela Q em Python
- Aprendizado Q profundo
- Explorando o OpenAI Gym