视频 01 来源笔记:什么是 Agent
来源元信息
- 讲者:小单说AI
- Bilibili:
BV1jbXKBGECC - 本地字幕:
从零实现自己的agent第一期:什么是agent.ai-zh.srt - 字幕覆盖:
00:00:00–00:04:36 - 对照材料:
bilibili-transcripts/01-什么是Agent.txt、ppt/第一期-什么是agent.html - 对应教学代码:本期是概念导入,代码从
step01_single_call.py开始
按时间顺序的主题窗口
[00:00:00–00:00:47] 从“只能说”到“能够做”
普通聊天模型被限制在对话框内,不能自行写文件、执行命令或搜索代码。视频用“坐在轮椅上的大脑”解释问题:模型会推理,但缺少与外部世界交互的执行通道。Agent 的直接价值,是给模型接上手、脚和眼睛。
[00:00:47–00:01:04] Agent 的组成
视频给出 LLM + 规划 + 记忆 + 工具 + 感知 的教学定义。它适合建立整体心智模型;工程实现时还要补上 Harness,也就是负责循环、状态、权限、错误恢复和观测的运行外壳。
[00:01:04–00:01:22] 规划
规划让复杂目标变成可执行步骤,并允许失败后调整。示例把“做一个网站”拆成数据库、前端和后端。后续第 4 期会把脑内规划升级为可写入、可检查的外部状态。
[00:01:22–00:01:37] 记忆
短期信息留在上下文,长期信息被整理为知识和经验。视频用向量数据库概括长期记忆,但长期记忆不等于向量数据库;文件、结构化记录、事件日志与数据库都可以成为存储载体。
[00:01:37–00:01:51] 工具
工具把模型的意图转换成真实动作,例如搜索、代码执行、文件读写与 API 调用。这是 Agent 从“生成文字”跨到“改变环境”的关键边界,也是权限控制最需要谨慎的位置。
[00:01:51–00:02:03] 感知
文字、图片、语音、环境状态和用户反馈都可以成为输入。感知不是只指多模态模型,也包括工具返回值、测试结果和运行日志。
[00:02:03–00:02:22] 核心循环
最小闭环是:思考 → 选择动作 → 执行 → 观察 → 再思考,直到满足停止条件。PPT 将其明确为 Agent Loop;后续 step05_tool_use.py 首次把这个循环写进代码。
[00:02:22–00:02:54] 能力边界
Agent 的能力由需求清晰度、模型、上下文和可用工具共同决定。它不能替用户承担价值判断。视频强调“说明白需求、提供正确工具”,工程上还应补充预算、最大循环次数、权限和人工批准。
[00:02:54–00:03:17] OpenClaw 案例
视频把长期对话、任务拆解与工具调用视为典型 Agent 能力。该案例的作用是去神秘化,而不是证明所有 Agent 的实现复杂度相同。
[00:03:17–00:03:59] Claude Code 与工具设计
工具不是越多越好。过多工具说明会挤占上下文,也会增加选择错误。更准确的工程原则是:提供覆盖核心动作的最小工具集,并通过动态发现、Skill 或分层注册按需扩展。
[00:03:59–00:04:36] 系列路线
视频承诺从不到百行的核心代码开始,逐步加入上下文、工具、Skill、记忆和协作能力。真正的学习目标不是背概念,而是能看到每次迭代解决了哪个失败模式。
主教学论点
Agent 不是一个神秘的新模型,而是“模型在循环中读取上下文并使用工具”的工程系统。模型负责选择,Harness 负责让选择可以执行、可观察、可约束。
演示与代码演进提示
- 先运行
step01_single_call.py,观察它只能完成一次回答。 - 再看
step02_loop_no_memory.py和step03_history.py,区分“循环”与“记住”。 - 到
step05_tool_use.py时,用事件序列观察assistant/tool_use → tool_result → assistant。 - 在 Mini Emperor 中,对应
AgentRunner.run_turn()、ToolRegistry.invoke()和连续产出的AgentEvent。
重要比喻
- “坐在轮椅上的大脑”:说明 LLM 有推理能力但没有行动通道。
- “装上手、脚、眼睛”:分别映射执行工具与感知输入。
- 比喻只解释职责,不代表模型天然安全,也不代表接入工具后就能可靠完成任务。
术语与纠正
- 本地自动字幕中的 “A技能 / A键” 均应理解为 Agent。
- “open crew / open crow” 应理解为视频所指的 OpenClaw。
- “cloud code” 应为 Claude Code。
- PPT 给出的
Agent = LLM + Tools是最小公式;视频口述的五项公式是教学展开,两者不冲突。
需要工程限定的说法
- “写代码、操作数据库都非常容易”只适用于工具、权限和验证条件充分的任务。
- “模型比 99% 的人聪明”是强调减少微观干预的修辞,不是可验证结论。
- “只给基础工具,让它自己创造”必须受到沙箱、能力策略和人工审批约束。
- Agent 不能用自然语言自述证明任务完成,必须用测试、文件检查或业务指标验收。
来源映射
- CAE:
step01_single_call.py至step06_skills.py展开最小公式。 - 《深入理解 AI Agent》:第 1 章“现代 Agent = LLM + 上下文 + 工具”“ReAct 循环”“Harness 工程”。
- Mini Emperor:
agent.py中的AgentRunner、AgentEvent、CapabilityPolicy、ToolRegistry。 - 进入正文:
book/00-agent全景.md、book/01-什么是Agent.md。
内容差异与待核对
- 仓库文本稿对专有名词做了部分清洗,但仍有转写错误;概念判断以代码和 PPT 为准。
- 视频把“长期记忆”快速归结为向量数据库;第 3 期和书第 3 章展示了更丰富的存储方式。
- 本期 PPT 有 13 页,主要章节“痛点、定义、四要素、核心循环、能力边界、案例、工具目录”均在上述窗口覆盖。