强化学习
从基本概念和 Bellman 方程,到动态规划与 Monte Carlo 学习。
课程导航与课程讲次
课程讲次
全部课程
5 篇公开记录
- Lec1: Basic Concepts in Reinforcement Learning以方格世界为例,构建强化学习的基础数学框架:状态、动作、奖励、状态转移、策略、轨迹与回报,以及引入折扣率后的折扣回报,最终统一为马尔可夫决策过程(MDP)。
- Lec4: Value Iteration & Policy Iteration求解 Bellman 最优方程的两条经典路径:Value Iteration 直接迭代 Bellman 算子,Policy Iteration 在策略评估与改进之间交替,并讨论二者的等价性与收敛性。
- Lec5: Monte Carlo Learning从 Model-based 走向 Model-free:用蒙特卡洛采样估计动作价值,介绍 MC Basic、Exploring Starts 与 ε-Greedy 等同策略 MC 方法。

