第2章:大脑、手脚与记忆
本章解决的核心问题:一个 Agent 内部到底是怎么运作的?它怎么把一个模糊目标拆成可执行的步骤?它怎么「记住」之前做过的事?它的「大脑」「手脚」「记忆」之间是什么关系?
读完这一章,你会看到一个 Agent 的完整「解剖图」。
2.1 Agent 的经典架构

🎨 漫画图解:〈Agent 透明解剖室〉
先把 Agent 拆开。下面这张图是几乎所有现代 LLM Agent 的通用架构:
flowchart TB
User[👤 用户输入] --> Agent
subgraph Agent[🤖 AI Agent]
direction TB
Brain[🧠 大脑 LLM
推理 · 决策 · 生成]
Plan[📋 规划模块
目标分解 · 步骤排序]
Mem[💾 记忆系统
短期 · 长期 · 经验]
Tools[🔧 工具层
搜索 · API · 文件 · 终端]
Brain <-->|思考与决策| Plan
Brain <-->|读写记忆| Mem
Brain -->|决定调用工具| Tools
Tools -->|返回结果| Brain
end
Tools <-->|交互| World[🌍 外部世界
网页 · 数据库 · 文件系统 · API]
User -->|反馈| Brain这张图里的每个模块,我们逐一拆开看。
2.2 大脑:LLM 在 Agent 里的角色
Agent 的大脑就是一个大语言模型(LLM)。没有 LLM,Agent 就是一个没有灵魂的躯壳。
但 LLM 在 Agent 里的角色,跟在 ChatGPT 里的角色不太一样:
| ChatGPT 里的 LLM | Agent 里的 LLM | |
|---|---|---|
| 输入 | 用户消息 | 用户消息 + 工具返回结果 + 记忆检索结果 + 任务计划 |
| 输出 | 纯文本回复 | 文本回复 + 工具调用指令(JSON) |
| 任务 | 理解和生成文本 | 推理、决策、规划、纠错 |
| 工作方式 | 一回合结束 | 多回合循环 |
Agent 里的 LLM 不只是一个「回答者」,它是一个「决策者」。 它需要判断:「现在是什么情况?我该干什么?我需不需要查点什么?上一个操作成功了吗?下一步是不是该换个策略?」
这种「元认知」能力——知道自己在干什么、评估自己的进度、在发现错误时调整策略——是 Agent 区别于普通聊天机器人的关键。
2.3 规划模块:从模糊目标到执行步骤

🎨 漫画图解:〈三种规划法闯迷宫〉
这是 Agent 最展现「智能」的地方。用户说「帮我做一份竞品分析」,这句话在 Agent 内部要拆成这样:
flowchart TB
Goal[🎯 用户目标:帮我做一份竞品分析] --> Step1
subgraph 规划
direction TB
Step1[步骤1:确认行业和主要竞品名单]
Step2[步骤2:搜索各家产品信息]
Step3[步骤3:对比功能、定价、市场份额]
Step4[步骤4:搜索用户评价和第三方评测]
Step5[步骤5:生成结构化分析报告]
Step6[步骤6:检查报告完整性 → 有遗漏则回到步骤2]
end
Step1 --> Step2 --> Step3 --> Step4 --> Step5 --> Step6Agent 不是一次性规划好所有步骤——它通常是边执行边规划。因为现实世界的反馈往往是不可预测的:你搜到的竞品可能和你预想的不一样,数据源可能打不开,报告格式可能需要调整。
主流规划方法
现在业界最主流的 Agent 规划方法有三类,我用人话逐一翻译:
ReAct(Reasoning + Acting):边想边干
全称:Reasoning + Acting。2022 年由 Google 和普林斯顿的团队提出。
核心思想:不要「先全局规划再执行」,而是要「想一步、做一步、看一眼结果、再想下一步」。
flowchart LR
T1[💭 思考:我需要知道竞品有哪些] --> A1[🔧 行动:搜索「新能源汽车 主要品牌 2025」]
A1 --> O1[👁️ 观察:搜到了比亚迪、蔚来、小鹏、理想...]
O1 --> T2[💭 思考:名单有了。接下来我需要各家2025年的销量数据]
T2 --> A2[🔧 行动:依次搜索各家销量]
A2 --> O2[👁️ 观察:拿到了数据,但蔚来的数据有矛盾...]
O2 --> T3[💭 思考:数据有矛盾,我需要交叉验证]
T3 --> A3[🔧 行动:搜索「蔚来 2025 销量 官方数据」]ReAct 是目前使用最广泛的 Agent 推理框架。LangChain、AutoGPT、Claude Code 都在不同程度上使用了 ReAct 的思想。
为什么 ReAct 有效? 因为它模仿了人类解决复杂问题的方式——没有人会在开始做一件事之前把所有细节都规划好。我们都是「走一步看一步,边做边调整」。
Plan-and-Solve:先规划再执行
核心思想:先让 LLM 用一个专门的「规划提示词」把整个任务计划写好,然后让另一个专门的「执行提示词」按计划逐步执行。
优点:全局视角,不容易跑偏。
缺点:计划往往不切实际——因为 LLM 在规划时「不知道」执行中会遇到什么问题。就像你让一个没去过超市的人写购物清单——他可能会写上「新鲜松露」,但那东西在你家楼下超市根本买不到。
思维树(Tree of Thoughts):多条路同时探索
核心思想:不要只规划一条路线。让 LLM 同时生成多个可能的「下一步」,评估每个选项,选最优的走——如果走不通,退回分叉点走另一条。
flowchart TB
Start[问题:如何获取竞品数据?]
Start --> A[方案A:搜索行业报告]
Start --> B[方案B:爬取官网数据]
Start --> C[方案C:购买第三方数据]
A --> A1[找到了报告 ✓]
A --> A2[报告数据太旧 ✗]
B --> B1[官网有反爬 ✗]
C --> C1[数据最新但成本高 🤔]
A1 --> Best[选方案A!]适用场景:选项多、不确定性高的任务——比如策略研究、创意生成。不适合:确定性高、步骤明确的任务——那些用 ReAct 更快。
类比:ReAct 是「走迷宫时每到岔路口就看一眼墙上的标记」;Plan-and-Solve 是「进迷宫之前先画一张地图」;思维树是「在每个岔路口派三个人分别走三条路,谁先到终点就喊其他人过来」。
2.4 记忆系统:Agent 的三层记忆

🎨 漫画图解:〈三层记忆公寓〉
记忆是 Agent 最容易被忽视、但最关键的能力。一个没有记忆的 Agent 就像一个永远在失忆的人——你刚告诉它你的名字,下一秒钟它就忘了。
flowchart TB
subgraph 记忆系统
direction TB
WM[📝 短期记忆
Working Memory
当前对话上下文
容量:~128K-200K tokens
生命周期:单次会话]
LM[📚 长期记忆
Long-term Memory
向量数据库存储
容量:近乎无限
生命周期:跨会话持久化]
EM[🧬 经验记忆
Episodic Memory
任务执行轨迹
容量:取决于存储设计
生命周期:可配置]
end
WM -->|重要信息持久化| LM
LM -->|检索相关知识| WM
EM -->|经验指导决策| WM短期记忆(上下文窗口)
短期记忆就是 LLM 的上下文窗口——模型在当前对话中能「看到」的所有内容。在 ChatGPT 里,这个上下文包含了你和它的对话历史。在 Agent 里,上下文包含:
- 用户最初的目标
- 之前的对话历史
- 工具调用的结果(搜索返回的内容、API 响应的数据)
- Agent 自己的思考记录
- 任务进度的跟踪
核心矛盾:上下文窗口是有限且昂贵的。
- GPT-4 Turbo 的上下文窗口是 128K tokens(大约 9 万多个英文单词,或 6 万多个中文字)。
- 听起来很大,但一个 Agent 任务跑几轮之后,工具返回的网页内容、API 响应、思考记录会迅速塞满它。
- 更关键的是:上下文越长,模型越贵、越慢、越容易在长文本中「迷失」——这被称为「迷失在中间」(Lost in the Middle)现象。
所以 Agent 不能什么都往上下文里塞——需要有一个长期记忆来分担。
长期记忆(向量数据库 + 持久化存储)
长期记忆把 Agent「经历过但不需要时刻想着」的信息存到外部。技术实现上,最常用的是向量数据库(在第3章详细讲)。
类比:短期记忆是你看病时医生手上拿的病例夹——包含这次就诊的关键信息。长期记忆是医院的电子病历系统——你的全部就诊历史、化验单、处方都在里面,医生需要时调出来看。
一个典型的 Agent 长期记忆使用场景:
你对 Agent 说「帮我整理一下上次我们讨论的那个营销方案」。
Agent 在长期记忆中搜索「营销方案」,找到三个月前的一段对话记录——那时候你们讨论过品牌定位、目标用户画像和投放渠道。Agent 把这段历史检索出来,放进当前上下文,然后基于这段历史给你整理。
如果没有长期记忆,Agent 只能说「我不记得我们讨论过这个」。
经验记忆(任务轨迹 + 失败教训)
经验记忆是三层记忆中最前沿、最少被落地的一个。它的核心思想是:Agent 应该从自己做过的事情中学习。
比如:
- 「上次做竞品分析时,我发现 Gartner 的报告质量最好,这次优先去 Gartner 找。」
- 「上次调用这个 API 时超时了三次,这次直接设置更长的 timeout。」
- 「这种格式的报告用户上次说太长了,这次压缩到两页。」
目前大多数 Agent 系统还没有成熟的经验记忆机制,但这是 Agent 进化的方向——第5章讲训练时会进一步讨论。
2.5 工具层:Agent 的手和脚

🎨 漫画图解:〈没有工具,只能干想〉
如果说 LLM 是 Agent 的大脑,工具就是 Agent 的手和脚。没有工具,Agent 就只能「想」不能「做」。
Agent 可以调用的工具类型:
| 工具类型 | 例子 | Agent 用它做什么 |
|---|---|---|
| 搜索 | Google Search API、Bing API、Tavily | 获取实时信息、验证事实 |
| 文件系统 | 读文件、写文件、列目录 | 操作本地文件 |
| 终端命令 | bash、PowerShell | 运行脚本、安装依赖、部署服务 |
| API 调用 | REST API、GraphQL | 发邮件、订机票、查天气、操作数据库 |
| 浏览器 | Playwright、Puppeteer | 打开网页、填表单、截图 |
| 代码执行 | Python 解释器 | 运行计算、数据分析、生成图表 |
| 数据库 | SQL 查询 | 读取和写入结构化数据 |
工具调用的具体机制(Function Calling)在第4章完整拆解,这里先理解它在 Agent 架构中的位置就够了。
2.6 一个完整案例:Agent 的「订机票」之旅

🎨 漫画图解:〈一次订机票任务的完整旅程〉
理论讲完了,来看一个具体的执行案例。假设你对 Agent 说:「帮我订一张后天从北京到上海的机票,要白天的,便宜优先。」
下面是 Agent 内部实际发生的事情:
sequenceDiagram
actor User as 👤 用户
participant Brain as 🧠 LLM 大脑
participant Mem as 💾 记忆
participant Tool1 as 🔍 搜索工具
participant Tool2 as ✈️ 机票API
participant Tool3 as 📅 日历工具
User->>Brain: 「帮我订后天北京到上海的白天机票,便宜优先」
Note over Brain: 💭 思考:我需要先知道「后天」是哪天
Brain->>Tool1: 调用:获取当前日期
Tool1-->>Brain: 今天是 2026年7月22日,后天是 7月24日
Note over Brain: 💭 思考:我需要查我的日历,看看7月24日有没有冲突
Brain->>Tool3: 调用:查询 2026-07-24 的日程
Tool3-->>Brain: 当天上午10点有会议,下午空闲
Note over Brain: 💭 思考:下午有空,可以订下午的航班。
现在去查机票。
Brain->>Tool2: 调用:搜索 PEK→SHA, 2026-07-24, 下午
Tool2-->>Brain: 返回 15 个航班,价格 480-2200 元
Note over Brain: 💭 思考:最便宜的三班:
1. 14:30 东航 480元
2. 16:00 国航 520元
3. 15:30 南航 610元
都在下午,用户有空。推荐第一个。
Brain->>User: 「后天(7月24日)下午您有空。
最便宜的航班:14:30 东航MU5123,480元。
要帮您订这个吗?」
User->>Brain: 「订」
Brain->>Tool2: 调用:预订 MU5123, 2026-07-24
Tool2-->>Brain: 预订成功!订单号 #A20260724-883
Brain->>Mem: 存储:2026-07-24 已订机票 MU5123
Brain->>User: 「已预订!✈️ 7月24日 14:30 北京→上海
东航MU5123 · 480元 · 订单号 #A20260724-883
起飞前2小时记得值机。」注意这个过程中,Agent 做了几件 LLM 做不到的事:
- 主动获取了当前日期——LLM 不知道「今天」是哪天。
- 查询了用户的日历——了解用户的时间安排。
- 调用了真实的机票 API——不是「编造」航班信息。
- 做了多条件筛选——白天、便宜优先,两个条件同时满足。
- 执行了写操作——不只是告诉你航班信息,而是真的帮你订了。
- 存储了记忆——把这次预订单记下来,下次可以问「我上次订的机票是几号的来着?」
本章小结
| 要点 | 一句话 |
|---|---|
| Agent 架构 | 大脑(LLM)+ 规划模块 + 记忆系统 + 工具层 |
| LLM 的新角色 | 在 Agent 里不是「回答者」,是「决策者」 |
| ReAct | 最主流的规划方法——想一步、做一步、看一眼、再想 |
| 三层记忆 | 短期(上下文窗口)、长期(向量数据库)、经验(任务轨迹) |
| 工具层 | Agent 的「手」——搜索、API、文件、终端、浏览器 |
| 核心矛盾 | 上下文窗口有限且贵,长期记忆是必需品不是奢侈品 |
下一章预告
刚才提到了一个关键概念——向量数据库,它是 Agent 长期记忆的技术基础。但它还有一个更重要的应用:RAG(检索增强生成)——这可能是 2024-2025 年 AI 落地最广的技术。
下一章我们彻底搞明白:RAG 到底是什么?它怎么把一段文字变成「能被搜索的向量」?RAG 和微调(Fine-tuning)有什么区别?什么时候该用哪个?
| ← 上一章 | 回到目录 | 下一章 → |
|---|---|---|
| 第1章:Agent 到底是什么 | 第3章:RAG |