标签

强化学习

强化学习学习笔记:从 MDP 到 Model-Based RL
本文是一份强化学习基础梳理。先交代 Agent 与 Environment 的交互,把 reward 折成 return;再用状态价值与动作价值,加上 Monte Carlo 和 TD 两条估计路线,说明"策略好不好"该怎么衡量;最后是值方法与策略方法这两条主线,从 SARSA 一路讲到 PPO 与 SAC,再落到 model-based RL 与模仿学习。
2026-09-04
|
2
|
0
|
0
强化学习学习笔记:从 MDP 到 Model-Based RL