强化学习
价值函数、策略学习与机器人控制。
专题导航
全部主题
13 篇公开记录
- 论文阅读Imitating Animals: 从动物模仿到真实四足敏捷运动RSS 2020 论文,DeepMimic 的真机续作:把动作捕捉先验从仿真特技搬到真实 Laikago 四足上,核心解决域差距与硬件磨损下的部署问题。
- 论文阅读Multi-AMP: 多重对抗动作先验学习高级技能AMP 的进阶版:用多个判别器分别建模不同风格(站立/行走/坐下等),让机器人按指令精确切换风格,并安全完成'坐下'这种传统 RL 难调参的高风险动作。
- 论文阅读
- 论文阅读MoE-Loco: 多任务腿足运动的专家混合架构MoE-Loco 用 Mixture of Experts 架构破解强化学习'多任务负迁移'的老问题,在 Actor-Critic 中引入门控专家,让单一策略同时精通行走、跑跳、攀爬等多种任务。
- 论文阅读PIE: Proprioception with Imagination for ParkourPIE 让低成本四足(如 Lite3)仅靠不可靠深度相机就能完成跨沟跳跃、高台攀爬等高难度跑酷动作,核心在于'想象式本体感知'弥补视觉退化时的环境建模。
- 论文阅读RMA: Rapid Motor Adaptation for Legged RobotsRSS 2021 论文 RMA:两阶段训练让四足机器人在线适应真实世界的不可预测物理(打滑、负载变化、电机磨损),实现毫秒级的快速运动自适应。
- 论文阅读
- 论文阅读DeepMimic: 从动作捕捉数据学习物理仿真角色技能SIGGRAPH 2018 论文 DeepMimic:把动作捕捉数据作为强约束奖励,结合 PPO + RSI + ET 训练物理仿真角色完成后空翻、回旋踢等高难度动作。
- Lec5: Monte Carlo Learning从 Model-based 走向 Model-free:用蒙特卡洛采样估计动作价值,介绍 MC Basic、Exploring Starts 与 ε-Greedy 等同策略 MC 方法。
- Lec4: Value Iteration & Policy Iteration求解 Bellman 最优方程的两条经典路径:Value Iteration 直接迭代 Bellman 算子,Policy Iteration 在策略评估与改进之间交替,并讨论二者的等价性与收敛性。
- Lec1: Basic Concepts in Reinforcement Learning以方格世界为例,构建强化学习的基础数学框架:状态、动作、奖励、状态转移、策略、轨迹与回报,以及引入折扣率后的折扣回报,最终统一为马尔可夫决策过程(MDP)。

