《深入理解 AI Agent》全量实验地图
固定版本:1c18370279f8f0457bf2c44dfa585d08d4d5f281
标记:
- 必做:七周主线的 15 个实验
- 选做:可在对应周加深理解
- 毕业后:重型训练、多模态、外部基准或硬件依赖
- ✅:仓库内可运行
- 📖:外部仓库/复现指南
仓库首页使用“92 个配套实验”的发布口径。固定版本中有 83 个一级实验目录,章节表格还包含外部仓库、一个目录对应多个对照实现,以及第 8 章补充案例,因此“目录数、表格行数、实验数”不能直接互换。本地图保留章节表的全部条目,不用目录数冒充实验数。
第 1 章 · Agent 基础
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
learning-from-experience | ✅ | 选做 | Q-learning 与上下文学习 |
web-search-agent | ✅ | 选做 | 搜索 API、Kimi |
search-codegen | ✅ | 选做 | 搜索与代码沙箱 |
context | ✅ | 第 1 周必做 | 多模型 API;上下文消融 |
第 2 章 · 上下文工程
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
local_llm_serving | ✅ | 毕业后 | Ollama/vLLM、本地模型 |
attention_visualization | ✅ | 选做 | 小模型、注意力可视化 |
kv-cache | ✅ | 选做 | Cache 命中与前缀稳定 |
context-compression | ✅ | 第 2 周必做 | 摘要、事实保持、Token |
prompt-engineering | ✅ | 选做 | Tau-Bench、Prompt A/B |
system-hint | ✅ | 选做 | System Prompt 行为影响 |
log-sanitization | ✅ | 选做 | 敏感信息脱敏 |
prompt-injection | ✅ | 第 2 周必做 | 3 类攻击、4 层防御 |
agent-skills-ppt | ✅ | 第 2 周必做 | 渐进式披露、python-pptx |
第 3 章 · 用户记忆和知识库
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
user-memory | ✅ | 第 3 周必做 | 跨会话记忆 |
mem0 / memobase | ✅ | 选做 | 两个记忆框架对照 |
user-memory-evaluation | ✅ | 选做 | 准确性、相关性、有效性 |
dense-embedding | ✅ | 选做 | ANNOY 与 HNSW |
sparse-embedding | ✅ | 选做 | 从零实现 BM25 |
retrieval-pipeline | ✅ | 第 3 周必做 | 稠密+稀疏+重排 |
multimodal-agent | ✅ | 毕业后 | 视觉模型与成本 |
structured-index | ✅ | 选做 | RAPTOR 与 GraphRAG |
agentic-rag | ✅ | 选做 | 迭代检索 |
agentic-rag-for-user-memory | ✅ | 选做 | 历史检索 |
contextual-retrieval | ✅ | 选做 | 上下文前缀摘要 |
contextual-retrieval-for-user-memory | ✅ | 选做 | 双层记忆结构 |
structured-knowledge-extraction | ✅ | 选做 | 因子、聚类、建议 |
第 4 章 · 工具与 MCP
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
perception-tools | ✅ | 选做 | 搜索、天气、地图、文件 |
execution-tools | ✅ | 选做 | 文件、代码、终端、审批 |
collaboration-tools | ✅ | 选做 | 浏览器、HITL、通知 |
agent-with-event-trigger | ✅ | 选做 | FastAPI 事件触发 |
active-tool-selection | ✅ | 选做 | 主动选择工具 |
active-tool-discovery | ✅ | 第 4 周必做 | 120+ Schema 与按需发现 |
async-agent | ✅ | 第 4 周必做 | 事件队列、并行、取消 |
docker-compose.yml / DOCKER_DEPLOYMENT.md | 文档 | 第 7 周 | 容器化 MCP |
第 5 章 · Coding Agent
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
coding-agent | ✅ | 第 6 周必做 | 17 个编码工具 |
code-for-math | ✅ | 选做 | SymPy/NumPy/SciPy |
code-for-logic | ✅ | 选做 | CSP 求解 |
small-model-codified-rules | ✅ | 选做 | 规则从 Prompt 搬到代码 |
paper-to-ppt | ✅ | 选做 | 生成与视觉 Reviewer |
paper-to-video | ✅ | 毕业后 | TTS、ffmpeg |
video-edit | ✅ | 毕业后 | Vision 与视频处理 |
adaptive-log-parser | ✅ | 选做 | 生成解析器与热更新 |
log-diagnosis | ✅ | 选做 | 根因、回归、重放 |
dynamic-form | ✅ | 选做 | HITL 信息补全 |
erp-agent | ✅ | 选做 | NL2SQL、Artifact |
conversational-ui | ✅ | 选做 | Agent 改 UI 与 HMR |
第 6 章 · Agent 评估
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
terminal-bench | 📖 | 毕业后 | 真实终端基准 |
SWE-bench | 📖 | 毕业后 | GitHub Issue 基准 |
GAIA | 📖 | 毕业后 | 工具/搜索/自主能力 |
OSWorld | 📖 | 毕业后 | 完整桌面环境 |
android_world | 📖 | 毕业后 | Android 基准源码 |
android-world | 📖 | 毕业后 | T3A 评估分析 |
tau2-bench | 📖 | 毕业后 | 工具推理基准 |
elo-leaderboard | ✅ | 选做 | 相对评分 |
model-benchmark | ✅ | 选做 | TTFT、p50/p95、吞吐 |
agent-cost-analysis | ✅ | 第 6 周必做 | 成本、Cache、压缩 A/B |
tts-quality-eval | ✅ | 毕业后 | TTS 与 LLM Judge |
public-health-reporting-eval | ✅ | 选做 | 工具、计算、证据评估 |
第 7 章 · 模型后训练
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
AdaptThink | 📖 | 毕业后 | 自适应 Thinking |
retool | 📖 | 毕业后 | SFT→RL、代码沙箱 |
AWorld / AWorld-train | 📖 | 毕业后 | 具身 Agent 训练 |
SFTvsRL | 📖 | 毕业后 | SFT/RL 对照 |
verl | 📖 | 毕业后 | PPO/GRPO/DAPO |
Intuitor | ✅ | 毕业后 | 直觉推理训练 |
MultilingualReasoning | ✅ | 毕业后 | 多语言推理 |
SpatialReasoning | 📖 | 毕业后 | 空间推理 |
SimpleVLA-RL | 📖 | 毕业后 | VLA 强化学习 |
continued-pretraining | ✅ | 毕业后 | 领域持续预训练 |
MiniMind-pretrain | 📖 | 毕业后 | 从零预训练 LLM/VLM |
sesame | ✅ | 毕业后 | 序列建模 |
orpheus | ✅ | 毕业后 | 音乐生成 |
tinker-cookbook | 📖 | 毕业后 | 训练技巧 |
cot-distillation | ✅ | 毕业后 | CoT 数据蒸馏 |
RLVP | 📖 | 毕业后 | 奖励结果、惩罚路径 |
第 8 章 · 持续进化
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
trajectory-verifier | ✅ | 第 5 周必做 | 带证据的轨迹诊断 |
gaia-experience | ✅ | 选做 | 跨轨迹经验文档 |
prompt-auto-optimization | ✅ | 第 5 周必做 | 最小 Prompt 补丁、保留集 |
browser-use-rpa | ✅ | 选做 | 轨迹编译与回放 |
self-modifying-agent | ✅ | 第 2 周必做 | 故障、补丁、灰度、回滚 |
self-evolution-eval | ✅ | 选做 | 学习、迁移、保持 |
self-evolving-tools | 补充 | 选做 | 工具发现与封装 |
prompt-distillation | 补充 | 毕业后 | Prompt 蒸馏 |
第 9 章 · 多模态与实时交互
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
live-audio | ✅ | 毕业后 | VAD+ASR+LLM+TTS |
browser-use | 📖 | 毕业后 | 浏览器自动化 |
claude-quickstarts | 📖 | 毕业后 | Claude API |
phone-agent | ✅ | 毕业后 | 电话工具 |
end-to-end-speech | ✅ | 毕业后 | 端到端语音 |
streaming-speech | ✅ | 毕业后 | 流式 ASR |
controllable-tts | ✅ | 毕业后 | 情感、语速与停顿 |
第 10 章 · 多 Agent 协作
| 项目 | 类型 | 建议 | 依赖/重点 |
|---|---|---|---|
use-computer-while-calling / TalkAct | 📖 | 毕业后 | 电话与浏览器并行 |
staged-system-prompt | ✅ | 第 3 周必做 | 分阶段 Prompt 与回退 |
multi-role-transfer | ✅ | 选做 | 角色 Handoff |
book-translation | ✅ | 选做 | Manager 与落盘制品 |
parallel-web-research | ✅ | 第 4 周必做 | 消息总线、竞态、级联终止 |
voice-werewolf | ✅ | 选做 | 私有上下文隔离 |
generative_agents | 📖 | 毕业后 | AI 小镇 |
15 个必做实验检查表
- [ ]
chapter1/context - [ ]
chapter2/context-compression - [ ]
chapter2/prompt-injection - [ ]
chapter2/agent-skills-ppt - [ ]
chapter8/self-modifying-agent - [ ]
chapter3/user-memory - [ ]
chapter3/retrieval-pipeline - [ ]
chapter10/staged-system-prompt - [ ]
chapter4/active-tool-discovery - [ ]
chapter4/async-agent - [ ]
chapter10/parallel-web-research - [ ]
chapter8/trajectory-verifier - [ ]
chapter8/prompt-auto-optimization - [ ]
chapter5/coding-agent - [ ]
chapter6/agent-cost-analysis