Deep Learning for Computer Vision
Stanford CS231N:从图像分类与卷积网络,到 Transformer、生成模型和三维视觉。
课程导航与课程讲次
课程讲次
全部课程
15 篇公开记录
- Lec8: 注意力与 Transformer从序列注意力到多头自注意力、Transformer Block 和 Vision Transformer。
- Lec14: 生成模型(二)GAN、Rectified Flow、条件生成、CFG,以及 Latent Diffusion 与 DiT。
- Lec15: 三维视觉深度与法线、体素、点云、网格、隐式场,以及 NeRF 与 3D Gaussian Splatting。
- Lec16: 视觉、语言与基础模型从 CLIP 的对比学习与零样本分类,到 LLaVA、Flamingo 和视觉语言模型链。

