强化学习基本概念
智能体、环境、奖励与惩罚
强化学习基本概念 是 CoddyKit 上的免费 Learn AI with Python 课时。 这是第 1 节课,共 5 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Learn AI with Python 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Learn AI with Python 课程共包含 5 节课。
什么是强化学习?
强化学习基础概念
强化学习(RL)是一种机器学习类型,其中智能体通过与环境互动来学习做出决策。其目标是随着时间的推移最大化奖励。
RL的关键组成部分包括智能体、环境、奖励和惩罚。

RL 中的关键术语
RL 中的关键术语
强化学习中的重要术语:
- 智能体:做出决策的实体(例如机器人或软件)。
- 环境:智能体与之交互的系统。
- 状态:环境当前所处的情况。
- 动作:智能体采取的决策。
- 奖励:环境针对某个动作提供的反馈。
智能体与环境的交互
智能体与环境的交互
智能体与环境的交互可以概括为:
- 智能体观察环境的当前状态。
- 智能体根据策略采取动作。
- 环境转移到新状态并提供奖励。
这个循环会持续进行,直到达到终止状态。
奖励与惩罚
奖励与惩罚
奖励是智能体因其动作而获得的反馈。目标是随着时间的推移最大化累积奖励。惩罚是负奖励,用于阻止不理想的动作。
例如:
- 奖励:到达目标可获得 +10。
- 惩罚:撞到障碍物会受到 -5。
RL中的策略
RL中的策略
策略是智能体根据当前状态决定动作时所使用的方法。
策略类型:
- 确定性:对于给定状态始终选择相同的动作。
- 随机性:按照概率选择动作。
探索与利用
探索与利用
智能体需要在以下两者之间进行权衡:
- 探索:尝试新的动作,以进一步了解环境。
- 利用:选择能够带来已知最高奖励的动作。
平衡这两者对于有效学习至关重要。
马尔可夫决策过程(MDP)
马尔可夫决策过程(MDP)
强化学习问题通常使用MDP建模,其定义包括:
- 状态(S):环境可能存在的配置。
- 动作(A):智能体可以做出的选择。
- 奖励(R):对动作的反馈。
- 转移概率(P):在状态之间转移的可能性。
强化学习中的挑战
强化学习中的挑战
强化学习面临一些挑战:
- 延迟奖励:可能要经过多次行动后才能获得奖励。
- 稀疏奖励:奖励可能很少发生。
- 高维性:环境包含许多状态和行动,因此十分复杂。
总结与后续步骤
总结与后续步骤
在本课中,我们:
- 探索了强化学习的基本概念,包括智能体、环境和奖励。
- 讨论了策略、探索与利用以及MDP。
- 了解了RL中的挑战。
接下来,我们将深入了解Q表概念,这是强化学习的一种基础方法。

常见问题解答
「强化学习基本概念」课时是免费的吗?
是的 — 「强化学习基本概念」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Learn AI with Python 课程的其余内容,请升级到 CoddyKit PRO。 Learn AI with Python 课程共包含 5 节课。
「强化学习基本概念」这节课中我会学到什么?
智能体、环境、奖励与惩罚 你通过在浏览器中直接运行的动手代码来练习 Learn AI with Python,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Learn AI with Python 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Learn AI with Python 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 5 节。
「强化学习基本概念」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Learn AI with Python 课中编写并运行代码吗?
能。每节 Learn AI with Python 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。