全部笔记 · 第 2 页
兼容总览:按课程、主题或全文搜索查找。
专题导航
搜索记录
72 篇公开记录
- Lec4: Value Iteration & Policy Iteration求解 Bellman 最优方程的两条经典路径:Value Iteration 直接迭代 Bellman 算子,Policy Iteration 在策略评估与改进之间交替,并讨论二者的等价性与收敛性。
- Lec1: Basic Concepts in Reinforcement Learning以方格世界为例,构建强化学习的基础数学框架:状态、动作、奖励、状态转移、策略、轨迹与回报,以及引入折扣率后的折扣回报,最终统一为马尔可夫决策过程(MDP)。
- 论文阅读日期未记录3D Common Corruptions and Data Augmentation 论文笔记3D Common Corruptions and Data Augmentation 阅读笔记 论文:3D Common Corruptions and Data Augmentation(CVPR 2022 Oral,arXiv 2203.01441v3) 作者:Oğuzhan Fatih Ka
- 编译原理日期未记录
- 编译原理日期未记录
- 编译原理日期未记录
- 编译原理日期未记录

