第2章:大脑、手脚与记忆

本章解决的核心问题:一个 Agent 内部到底是怎么运作的?它怎么把一个模糊目标拆成可执行的步骤?它怎么「记住」之前做过的事?它的「大脑」「手脚」「记忆」之间是什么关系?

读完这一章,你会看到一个 Agent 的完整「解剖图」。


2.1 Agent 的经典架构

assets/ai-agent-comics/ch02-01-anatomy.webp
🎨 漫画图解:〈Agent 透明解剖室〉

先把 Agent 拆开。下面这张图是几乎所有现代 LLM Agent 的通用架构:

flowchart TB
    User[👤 用户输入] --> Agent

    subgraph Agent[🤖 AI Agent]
        direction TB
        Brain[🧠 大脑 LLM
推理 · 决策 · 生成] Plan[📋 规划模块
目标分解 · 步骤排序] Mem[💾 记忆系统
短期 · 长期 · 经验] Tools[🔧 工具层
搜索 · API · 文件 · 终端] Brain <-->|思考与决策| Plan Brain <-->|读写记忆| Mem Brain -->|决定调用工具| Tools Tools -->|返回结果| Brain end Tools <-->|交互| World[🌍 外部世界
网页 · 数据库 · 文件系统 · API] User -->|反馈| Brain

这张图里的每个模块,我们逐一拆开看。


2.2 大脑:LLM 在 Agent 里的角色

Agent 的大脑就是一个大语言模型(LLM)。没有 LLM,Agent 就是一个没有灵魂的躯壳。

但 LLM 在 Agent 里的角色,跟在 ChatGPT 里的角色不太一样:

ChatGPT 里的 LLM Agent 里的 LLM
输入 用户消息 用户消息 + 工具返回结果 + 记忆检索结果 + 任务计划
输出 纯文本回复 文本回复 + 工具调用指令(JSON)
任务 理解和生成文本 推理、决策、规划、纠错
工作方式 一回合结束 多回合循环

Agent 里的 LLM 不只是一个「回答者」,它是一个「决策者」。 它需要判断:「现在是什么情况?我该干什么?我需不需要查点什么?上一个操作成功了吗?下一步是不是该换个策略?」

这种「元认知」能力——知道自己在干什么、评估自己的进度、在发现错误时调整策略——是 Agent 区别于普通聊天机器人的关键。


2.3 规划模块:从模糊目标到执行步骤

assets/ai-agent-comics/ch02-02-planning-maze.webp
🎨 漫画图解:〈三种规划法闯迷宫〉

这是 Agent 最展现「智能」的地方。用户说「帮我做一份竞品分析」,这句话在 Agent 内部要拆成这样:

flowchart TB
    Goal[🎯 用户目标:帮我做一份竞品分析] --> Step1

    subgraph 规划
        direction TB
        Step1[步骤1:确认行业和主要竞品名单]
        Step2[步骤2:搜索各家产品信息]
        Step3[步骤3:对比功能、定价、市场份额]
        Step4[步骤4:搜索用户评价和第三方评测]
        Step5[步骤5:生成结构化分析报告]
        Step6[步骤6:检查报告完整性 → 有遗漏则回到步骤2]
    end

    Step1 --> Step2 --> Step3 --> Step4 --> Step5 --> Step6

Agent 不是一次性规划好所有步骤——它通常是边执行边规划。因为现实世界的反馈往往是不可预测的:你搜到的竞品可能和你预想的不一样,数据源可能打不开,报告格式可能需要调整。

主流规划方法

现在业界最主流的 Agent 规划方法有三类,我用人话逐一翻译:

ReAct(Reasoning + Acting):边想边干

全称:Reasoning + Acting。2022 年由 Google 和普林斯顿的团队提出。

核心思想:不要「先全局规划再执行」,而是要「想一步、做一步、看一眼结果、再想下一步」。

flowchart LR
    T1[💭 思考:我需要知道竞品有哪些] --> A1[🔧 行动:搜索「新能源汽车 主要品牌 2025」]
    A1 --> O1[👁️ 观察:搜到了比亚迪、蔚来、小鹏、理想...]
    O1 --> T2[💭 思考:名单有了。接下来我需要各家2025年的销量数据]
    T2 --> A2[🔧 行动:依次搜索各家销量]
    A2 --> O2[👁️ 观察:拿到了数据,但蔚来的数据有矛盾...]
    O2 --> T3[💭 思考:数据有矛盾,我需要交叉验证]
    T3 --> A3[🔧 行动:搜索「蔚来 2025 销量 官方数据」]

ReAct 是目前使用最广泛的 Agent 推理框架。LangChain、AutoGPT、Claude Code 都在不同程度上使用了 ReAct 的思想。

为什么 ReAct 有效? 因为它模仿了人类解决复杂问题的方式——没有人会在开始做一件事之前把所有细节都规划好。我们都是「走一步看一步,边做边调整」。

Plan-and-Solve:先规划再执行

核心思想:先让 LLM 用一个专门的「规划提示词」把整个任务计划写好,然后让另一个专门的「执行提示词」按计划逐步执行。

优点:全局视角,不容易跑偏。
缺点:计划往往不切实际——因为 LLM 在规划时「不知道」执行中会遇到什么问题。就像你让一个没去过超市的人写购物清单——他可能会写上「新鲜松露」,但那东西在你家楼下超市根本买不到。

思维树(Tree of Thoughts):多条路同时探索

核心思想:不要只规划一条路线。让 LLM 同时生成多个可能的「下一步」,评估每个选项,选最优的走——如果走不通,退回分叉点走另一条。

flowchart TB
    Start[问题:如何获取竞品数据?]
    Start --> A[方案A:搜索行业报告]
    Start --> B[方案B:爬取官网数据]
    Start --> C[方案C:购买第三方数据]

    A --> A1[找到了报告 ✓]
    A --> A2[报告数据太旧 ✗]
    B --> B1[官网有反爬 ✗]
    C --> C1[数据最新但成本高 🤔]

    A1 --> Best[选方案A!]

适用场景:选项多、不确定性高的任务——比如策略研究、创意生成。不适合:确定性高、步骤明确的任务——那些用 ReAct 更快。

类比:ReAct 是「走迷宫时每到岔路口就看一眼墙上的标记」;Plan-and-Solve 是「进迷宫之前先画一张地图」;思维树是「在每个岔路口派三个人分别走三条路,谁先到终点就喊其他人过来」。


2.4 记忆系统:Agent 的三层记忆

assets/ai-agent-comics/ch02-03-memory-house.webp
🎨 漫画图解:〈三层记忆公寓〉

记忆是 Agent 最容易被忽视、但最关键的能力。一个没有记忆的 Agent 就像一个永远在失忆的人——你刚告诉它你的名字,下一秒钟它就忘了。

flowchart TB
    subgraph 记忆系统
        direction TB
        WM[📝 短期记忆
Working Memory

当前对话上下文
容量:~128K-200K tokens
生命周期:单次会话] LM[📚 长期记忆
Long-term Memory

向量数据库存储
容量:近乎无限
生命周期:跨会话持久化] EM[🧬 经验记忆
Episodic Memory

任务执行轨迹
容量:取决于存储设计
生命周期:可配置] end WM -->|重要信息持久化| LM LM -->|检索相关知识| WM EM -->|经验指导决策| WM

短期记忆(上下文窗口)

短期记忆就是 LLM 的上下文窗口——模型在当前对话中能「看到」的所有内容。在 ChatGPT 里,这个上下文包含了你和它的对话历史。在 Agent 里,上下文包含:

核心矛盾:上下文窗口是有限且昂贵的。

所以 Agent 不能什么都往上下文里塞——需要有一个长期记忆来分担。

长期记忆(向量数据库 + 持久化存储)

长期记忆把 Agent「经历过但不需要时刻想着」的信息存到外部。技术实现上,最常用的是向量数据库(在第3章详细讲)。

类比:短期记忆是你看病时医生手上拿的病例夹——包含这次就诊的关键信息。长期记忆是医院的电子病历系统——你的全部就诊历史、化验单、处方都在里面,医生需要时调出来看。

一个典型的 Agent 长期记忆使用场景:

你对 Agent 说「帮我整理一下上次我们讨论的那个营销方案」。

Agent 在长期记忆中搜索「营销方案」,找到三个月前的一段对话记录——那时候你们讨论过品牌定位、目标用户画像和投放渠道。Agent 把这段历史检索出来,放进当前上下文,然后基于这段历史给你整理。

如果没有长期记忆,Agent 只能说「我不记得我们讨论过这个」。

经验记忆(任务轨迹 + 失败教训)

经验记忆是三层记忆中最前沿、最少被落地的一个。它的核心思想是:Agent 应该从自己做过的事情中学习

比如:

目前大多数 Agent 系统还没有成熟的经验记忆机制,但这是 Agent 进化的方向——第5章讲训练时会进一步讨论。


2.5 工具层:Agent 的手和脚

assets/ai-agent-comics/ch02-04-tool-belt.webp
🎨 漫画图解:〈没有工具,只能干想〉

如果说 LLM 是 Agent 的大脑,工具就是 Agent 的手和脚。没有工具,Agent 就只能「想」不能「做」。

Agent 可以调用的工具类型:

工具类型 例子 Agent 用它做什么
搜索 Google Search API、Bing API、Tavily 获取实时信息、验证事实
文件系统 读文件、写文件、列目录 操作本地文件
终端命令 bash、PowerShell 运行脚本、安装依赖、部署服务
API 调用 REST API、GraphQL 发邮件、订机票、查天气、操作数据库
浏览器 Playwright、Puppeteer 打开网页、填表单、截图
代码执行 Python 解释器 运行计算、数据分析、生成图表
数据库 SQL 查询 读取和写入结构化数据

工具调用的具体机制(Function Calling)在第4章完整拆解,这里先理解它在 Agent 架构中的位置就够了。


2.6 一个完整案例:Agent 的「订机票」之旅

assets/ai-agent-comics/ch02-05-flight-journey.webp
🎨 漫画图解:〈一次订机票任务的完整旅程〉

理论讲完了,来看一个具体的执行案例。假设你对 Agent 说:「帮我订一张后天从北京到上海的机票,要白天的,便宜优先。」

下面是 Agent 内部实际发生的事情:

sequenceDiagram
    actor User as 👤 用户
    participant Brain as 🧠 LLM 大脑
    participant Mem as 💾 记忆
    participant Tool1 as 🔍 搜索工具
    participant Tool2 as ✈️ 机票API
    participant Tool3 as 📅 日历工具

    User->>Brain: 「帮我订后天北京到上海的白天机票,便宜优先」

    Note over Brain: 💭 思考:我需要先知道「后天」是哪天

    Brain->>Tool1: 调用:获取当前日期
    Tool1-->>Brain: 今天是 2026年7月22日,后天是 7月24日

    Note over Brain: 💭 思考:我需要查我的日历,看看7月24日有没有冲突

    Brain->>Tool3: 调用:查询 2026-07-24 的日程
    Tool3-->>Brain: 当天上午10点有会议,下午空闲

    Note over Brain: 💭 思考:下午有空,可以订下午的航班。
现在去查机票。 Brain->>Tool2: 调用:搜索 PEK→SHA, 2026-07-24, 下午 Tool2-->>Brain: 返回 15 个航班,价格 480-2200 元 Note over Brain: 💭 思考:最便宜的三班:
1. 14:30 东航 480元
2. 16:00 国航 520元
3. 15:30 南航 610元
都在下午,用户有空。推荐第一个。 Brain->>User: 「后天(7月24日)下午您有空。
最便宜的航班:14:30 东航MU5123,480元。
要帮您订这个吗?」 User->>Brain: 「订」 Brain->>Tool2: 调用:预订 MU5123, 2026-07-24 Tool2-->>Brain: 预订成功!订单号 #A20260724-883 Brain->>Mem: 存储:2026-07-24 已订机票 MU5123 Brain->>User: 「已预订!✈️ 7月24日 14:30 北京→上海
东航MU5123 · 480元 · 订单号 #A20260724-883
起飞前2小时记得值机。」

注意这个过程中,Agent 做了几件 LLM 做不到的事:

  1. 主动获取了当前日期——LLM 不知道「今天」是哪天。
  2. 查询了用户的日历——了解用户的时间安排。
  3. 调用了真实的机票 API——不是「编造」航班信息。
  4. 做了多条件筛选——白天、便宜优先,两个条件同时满足。
  5. 执行了写操作——不只是告诉你航班信息,而是真的帮你订了。
  6. 存储了记忆——把这次预订单记下来,下次可以问「我上次订的机票是几号的来着?」

本章小结

要点 一句话
Agent 架构 大脑(LLM)+ 规划模块 + 记忆系统 + 工具层
LLM 的新角色 在 Agent 里不是「回答者」,是「决策者」
ReAct 最主流的规划方法——想一步、做一步、看一眼、再想
三层记忆 短期(上下文窗口)、长期(向量数据库)、经验(任务轨迹)
工具层 Agent 的「手」——搜索、API、文件、终端、浏览器
核心矛盾 上下文窗口有限且贵,长期记忆是必需品不是奢侈品

下一章预告

刚才提到了一个关键概念——向量数据库,它是 Agent 长期记忆的技术基础。但它还有一个更重要的应用:RAG(检索增强生成)——这可能是 2024-2025 年 AI 落地最广的技术。

下一章我们彻底搞明白:RAG 到底是什么?它怎么把一段文字变成「能被搜索的向量」?RAG 和微调(Fine-tuning)有什么区别?什么时候该用哪个?

第3章:RAG——给 Agent 装上外部知识库


← 上一章 回到目录 下一章 →
第1章:Agent 到底是什么 第3章:RAG