Skip to content

视频 01 来源笔记:什么是 Agent

来源元信息

  • 讲者:小单说AI
  • Bilibili:BV1jbXKBGECC
  • 本地字幕:从零实现自己的agent第一期:什么是agent.ai-zh.srt
  • 字幕覆盖:00:00:00–00:04:36
  • 对照材料:bilibili-transcripts/01-什么是Agent.txtppt/第一期-什么是agent.html
  • 对应教学代码:本期是概念导入,代码从 step01_single_call.py 开始

按时间顺序的主题窗口

[00:00:00–00:00:47] 从“只能说”到“能够做”

普通聊天模型被限制在对话框内,不能自行写文件、执行命令或搜索代码。视频用“坐在轮椅上的大脑”解释问题:模型会推理,但缺少与外部世界交互的执行通道。Agent 的直接价值,是给模型接上手、脚和眼睛。

[00:00:47–00:01:04] Agent 的组成

视频给出 LLM + 规划 + 记忆 + 工具 + 感知 的教学定义。它适合建立整体心智模型;工程实现时还要补上 Harness,也就是负责循环、状态、权限、错误恢复和观测的运行外壳。

[00:01:04–00:01:22] 规划

规划让复杂目标变成可执行步骤,并允许失败后调整。示例把“做一个网站”拆成数据库、前端和后端。后续第 4 期会把脑内规划升级为可写入、可检查的外部状态。

[00:01:22–00:01:37] 记忆

短期信息留在上下文,长期信息被整理为知识和经验。视频用向量数据库概括长期记忆,但长期记忆不等于向量数据库;文件、结构化记录、事件日志与数据库都可以成为存储载体。

[00:01:37–00:01:51] 工具

工具把模型的意图转换成真实动作,例如搜索、代码执行、文件读写与 API 调用。这是 Agent 从“生成文字”跨到“改变环境”的关键边界,也是权限控制最需要谨慎的位置。

[00:01:51–00:02:03] 感知

文字、图片、语音、环境状态和用户反馈都可以成为输入。感知不是只指多模态模型,也包括工具返回值、测试结果和运行日志。

[00:02:03–00:02:22] 核心循环

最小闭环是:思考 → 选择动作 → 执行 → 观察 → 再思考,直到满足停止条件。PPT 将其明确为 Agent Loop;后续 step05_tool_use.py 首次把这个循环写进代码。

[00:02:22–00:02:54] 能力边界

Agent 的能力由需求清晰度、模型、上下文和可用工具共同决定。它不能替用户承担价值判断。视频强调“说明白需求、提供正确工具”,工程上还应补充预算、最大循环次数、权限和人工批准。

[00:02:54–00:03:17] OpenClaw 案例

视频把长期对话、任务拆解与工具调用视为典型 Agent 能力。该案例的作用是去神秘化,而不是证明所有 Agent 的实现复杂度相同。

[00:03:17–00:03:59] Claude Code 与工具设计

工具不是越多越好。过多工具说明会挤占上下文,也会增加选择错误。更准确的工程原则是:提供覆盖核心动作的最小工具集,并通过动态发现、Skill 或分层注册按需扩展。

[00:03:59–00:04:36] 系列路线

视频承诺从不到百行的核心代码开始,逐步加入上下文、工具、Skill、记忆和协作能力。真正的学习目标不是背概念,而是能看到每次迭代解决了哪个失败模式。

主教学论点

Agent 不是一个神秘的新模型,而是“模型在循环中读取上下文并使用工具”的工程系统。模型负责选择,Harness 负责让选择可以执行、可观察、可约束。

演示与代码演进提示

  1. 先运行 step01_single_call.py,观察它只能完成一次回答。
  2. 再看 step02_loop_no_memory.pystep03_history.py,区分“循环”与“记住”。
  3. step05_tool_use.py 时,用事件序列观察 assistant/tool_use → tool_result → assistant
  4. 在 Mini Emperor 中,对应 AgentRunner.run_turn()ToolRegistry.invoke() 和连续产出的 AgentEvent

重要比喻

  • “坐在轮椅上的大脑”:说明 LLM 有推理能力但没有行动通道。
  • “装上手、脚、眼睛”:分别映射执行工具与感知输入。
  • 比喻只解释职责,不代表模型天然安全,也不代表接入工具后就能可靠完成任务。

术语与纠正

  • 本地自动字幕中的 “A技能 / A键” 均应理解为 Agent
  • “open crew / open crow” 应理解为视频所指的 OpenClaw
  • “cloud code” 应为 Claude Code
  • PPT 给出的 Agent = LLM + Tools 是最小公式;视频口述的五项公式是教学展开,两者不冲突。

需要工程限定的说法

  • “写代码、操作数据库都非常容易”只适用于工具、权限和验证条件充分的任务。
  • “模型比 99% 的人聪明”是强调减少微观干预的修辞,不是可验证结论。
  • “只给基础工具,让它自己创造”必须受到沙箱、能力策略和人工审批约束。
  • Agent 不能用自然语言自述证明任务完成,必须用测试、文件检查或业务指标验收。

来源映射

  • CAE:step01_single_call.pystep06_skills.py 展开最小公式。
  • 《深入理解 AI Agent》:第 1 章“现代 Agent = LLM + 上下文 + 工具”“ReAct 循环”“Harness 工程”。
  • Mini Emperor:agent.py 中的 AgentRunnerAgentEventCapabilityPolicyToolRegistry
  • 进入正文:book/00-agent全景.mdbook/01-什么是Agent.md

内容差异与待核对

  • 仓库文本稿对专有名词做了部分清洗,但仍有转写错误;概念判断以代码和 PPT 为准。
  • 视频把“长期记忆”快速归结为向量数据库;第 3 期和书第 3 章展示了更丰富的存储方式。
  • 本期 PPT 有 13 页,主要章节“痛点、定义、四要素、核心循环、能力边界、案例、工具目录”均在上述窗口覆盖。

Markdown 是唯一内容源,HTML 由构建流程生成。