# 路径二：深度学习 / 视觉 → 多模态 Agent · VLM · 机器人感知（独立路径）

> 与「路径一：LLM / 智能体自改进（CS329A）」**完全独立**的两条学习线。本路径聚焦**感知与具身**——从视觉与深度学习出发，走向**多模态 Agent、视觉-语言模型（VLM）、机器人感知**。
> 两条路径在「世界模型 / 物理 AI / 通用智能」处汇合，见文末「融合点」。

---

## P1 · 地基：深度学习 + 计算机视觉

| 课程 | 名称 | 主讲 | 关键内容 |
|------|------|------|---------|
| **CS229** | Machine Learning | Andrew Ng | 前置：回归/分类/神经网络（ML 基础） |
| **CS230** | Deep Learning | Andrew Ng | 深度学习机制 + 项目领导 |
| **CS231N** ⭐ | Deep Learning for Computer Vision | **Fei-Fei Li** 等 | **视觉核心**：CNN→ViT→图像分类/检测/分割→**CLIP/VLM**→生成/扩散→**世界建模** |

## P2 · 多模态 / 视觉-语言

- **CS224N**（NLP with Deep Learning）——语言半边，VLM 的文本侧
- **CS231N** 的 Vision+Language / World Modeling 讲座（Embedding 对齐、CLIP、diffusion）
- 实践：用 **CLIP / 开源 VLM** 做多模态理解，把 VLM 作为多模态 Agent 的 `perception` 模块
- 斯坦福在线：**XCS231N**（Deep Learning for Computer Vision，Fei-Fei Li 主讲）

## P3 · 机器人感知 / 具身

| 课程 | 名称 | 方向 |
|------|------|------|
| **CS223A** | Introduction to Robotics（Khatib） | 机器人运动学 / 动力学 / 控制基础 |
| **CS225A** | Experimental Robotics | 真实机器人 + 自研控制项目 |
| **CS327A** | Advanced Robotics | 非线性控制 / 全身 / 双臂操作 |
| （研究前沿） | 具身 AI / 机器人学习 | 斯坦福对应 **Physical Intelligence**（CS329A 客座）、HAI 等实验室 |

> 注：斯坦福机器人课偏**经典控制**流派；「学习式机器人感知 / 具身智能」主要还在**研究前沿**（VLM-Agent 控制机器人、视频预训练、world-model 规划），无单一明星公开课。

---

## 融合点 · 世界模型 / 物理 AI / 通用智能（两条路径在此汇合）

**为何在此整合**：世界模型把「感知(视觉) + 预测(环境演化) + 行动(规划/控制) + 语言(LLM)」统一到同一个内部模型，是通往**物理 AI / 通用智能体**的枢纽。

- **代表系统**：
  - DreamerV3（Hafner et al., **Nature 2025**）— 用世界模型跨域掌握 Atari/Go/棋盘
  - **Genie 3**（DeepMind）— 实时交互世界模型
  - **NVIDIA Cosmos** — 物理 AI 平台（机器人/自动驾驶）
  - **World Labs（Fei-Fei Li）/ Project Marble** — 世界模型生成
  - **AMI Labs（LeCun，2026）** — 理解物理、持久记忆、规划的世界模型 AGI
- **与路径一的整合**：
  - 路径一（LLM/智能体自改进）：搜索、测试时计算、记忆、评估 —— 偏「符号/语言推理」
  - 路径二（视觉/具身）：感知、世界模型、控制 —— 偏「物理/连续动作空间」
  - **汇合** = 具备**物理世界理解 + 语言推理 + 自我改进 + 规划行动** 的**通用智能体**

---

## 公开资源
- CS231N：https://cs231n.stanford.edu ｜ CS224N：https://web.stanford.edu/class/cs224n
- CS223A：https://cs.stanford.edu/groups/manips/teaching/cs223a ｜ CS225A / CS327A：Stanford Robotics Lab（https://khatib.stanford.edu）
- 世界模型：https://arxiv.org/html/2606.12783v1（Tutorial on World Models & Physical AI）｜ DreamerV3 Nature 2025
