第1章:Agent 到底是什么
本章解决的核心问题:AI Agent 和 ChatGPT 这种「聊天机器人」到底有什么本质区别?为什么 2024-2025 年所有人都在谈 Agent?读完这一章,你能在同事面前解释清楚「Agent 不是聊天软件——它是能替你干活的 AI」。
1.1 一个场景开始

🎨 漫画图解:〈同一个大脑,多了一双手〉
先想象两个场景。
场景 A:你打开 ChatGPT,输入「帮我写一份关于新能源汽车市场的报告」。几十秒后,ChatGPT 吐出一份结构完整、数据看起来像回事的报告。你读了一遍,发现有些数据是编的,于是又追问了几轮,最终得到了一份能用的初稿。
场景 B:你对一个 AI Agent 说同样的话。它没有立刻吐报告。它先搜索了最近三个月的新能源汽车新闻和行业报告,对比了多家数据源。它发现中汽协的官网有一份最新统计,于是自己打开了那个网页,提取了数据。然后它生成了一个 PPT,把图表嵌了进去,发到了你的邮箱。整个过程你只说了那一句话。
场景 A 和场景 B 的区别,就是大语言模型(LLM)和 AI Agent 之间的那条红线。
| LLM(ChatGPT) | AI Agent | |
|---|---|---|
| 能做什么 | 理解和生成文本 | 理解、规划、执行、验证 |
| 交互方式 | 你问一句,它答一句 | 你给目标,它自己拆步骤 |
| 能否使用工具 | 不能(除非插件) | 核心能力 |
| 能否获取实时信息 | 不能(知识有时效) | 能(可以自己搜索) |
| 能否操作外部系统 | 不能 | 能(发邮件、写文件、调 API) |
| 工作模式 | 一问一答 | 循环:思考 → 行动 → 观察 → 再思考 |
一句话总结:LLM 是一个知识渊博但困在聊天框里的人。Agent 是给他配了手机、电脑、银行卡、车钥匙之后的版本——不仅能聊,还能办事。
1.2 Agent 的经典定义:Sense → Think → Act

🎨 漫画图解:〈Agent 的行动循环〉
「Agent」这个词在 AI 领域其实很老了,不是新概念。早在 1990 年代,AI 研究者就已经在讨论「智能体」——能在环境中自主感知和行动的系统。
现代 AI Agent 的核心循环可以用三个词概括:
flowchart LR
S[👁️ 感知
Sense] --> T[🧠 思考
Think]
T --> A[🦾 行动
Act]
A --> O[👁️ 观察
Observe]
O --> T这个循环翻译成人话:
- 感知(Sense):Agent 从环境中获取信息。环境可以是用户的输入、网页内容、API 返回的数据、文件内容——任何能被 Agent「看到」的东西。
- 思考(Think):Agent 分析当前状态,推理下一步该做什么。这个「思考」能力来自它的大脑——一个大语言模型。模型评估当前情况,决定一个行动计划。
- 行动(Act):Agent 执行决定——可能是在终端里跑一条命令、调用一个 API、打开一个网页、生成一段文本。
- 观察(Observe):Agent 检查行动的结果。成功了?失败了?结果是不是自己预期的?然后回到第 2 步,根据观察结果调整下一步。
这就是 Agent 和 LLM 最本质的区别:LLM 停在「思考」这一步。Agent 多了一个「行动-观察-再思考」的循环。 这多出来的一步,是质的飞跃。
1.3 一个生活化类比
为了帮你把这个概念焊死在脑子里,我讲一个故事。
想象一个叫小狗的年轻人。
小狗(LLM 版本):小狗从小被困在一个房间里,靠读书过活。他读完了世界上所有的书——百科全书、维基百科、学术论文、小说、技术文档——什么都读过。你问他任何问题,他都能引经据典地回答,有逻辑、有深度。
但他的房间没有窗户、没有门。你看不见他,他也看不见外面。他给不了你今天的气温,因为他不知道今天是几月几号。他帮你订不了机票,因为他的房间里没有电脑也没有手机。
小狗(Agent 版本):有一天,你给了小狗一部手机。
现在,当你问他「今天天气怎么样」,他不再依靠书本上「北京7月平均气温26度」这样的过时知识——他会打开手机上的天气应用,查一下实时数据,然后告诉你。
当你对他说「帮我和家人预订一家周六晚上的法餐厅」,他会:先查看你的日程(确认周六晚上有空),然后搜附近的法餐厅,逐家查看评分和是否有空位,挑出三个最佳选项发给你。等你选了之后,他自己打电话订座,然后把确认短信转发给你。
同一个「大脑」,多了一双「手」,它就从「图书馆管理员」变成了「私人助理」。
这个类比不是鸡汤,它是 AGI 研究者们真心相信的路线图:现有的 LLM 已经有足够的「智力」,缺的是和环境交互的「身体」。Agent 框架解决的就是这个问题。
1.4 Agent 的四个核心能力

🎨 漫画图解:〈Agent 的四件装备〉
把 Sense-Think-Act 循环再拆细一点,一个合格的 Agent 需要四项核心能力:
mindmap
root((Agent 核心能力))
感知 Perception
读取用户输入
获取工具返回结果
监控环境状态
规划 Planning
目标分解
步骤排序
资源评估
备选方案
执行 Execution
调用工具/API
写文件/发请求
操作外部系统
记忆 Memory
短期:上下文窗口
长期:向量数据库
经验:成功/失败记录感知(Perception)
Agent 的「感官」。输入可以是自然语言(用户说的)、结构化数据(API 返回的 JSON)、非结构化数据(网页内容、PDF 文档)、甚至是多模态输入(图片、音频)。
一个优秀的 Agent 不是被动地接收输入——它会主动去「感知」,比如自己去搜、自己去查、自己去验证。
规划(Planning)
这是 Agent 智力的核心体现。一个模糊的用户指令——「帮我做市场调研」——在 Agent 脑子里要变成一连串可执行的子任务:
- 确定调研的行业和范围
- 搜索近一年的行业报告
- 提取关键数据和趋势
- 对比主要竞品
- 生成结构化报告
在第2章我们会详细拆解 Agent 的规划机制——ReAct、思维链、思维树这些听着很酷的词到底是什么意思。
执行(Execution)
Agent 的手。工具调用是 Agent 和外部世界交互的唯一方式——不管是搜网页、调用 API、操作文件还是发邮件,底层都是「Agent 输出一个工具调用的请求,外部程序执行并返回结果」。第4章会完整拆解这个过程。
记忆(Memory)
人类做事靠记忆:你知道自己是谁、昨天干了什么、刚才查到了什么信息。Agent 也一样——如果没有记忆,它每说一句话都是「从零开始」,像一个永远在失忆的人。
Agent 的记忆分三层(第2章详讲):
- 短期记忆:当前对话的上下文,类似你的「工作记忆」。
- 长期记忆:跨会话持久化存储的信息,类似你的「长期记忆」。
- 经验记忆:过去任务中的成功&失败经验,类似你的「肌肉记忆」。
1.5 为什么 Agent 是现在才火的

🎨 漫画图解:〈Agent 为什么现在才醒来〉
这个问题值得认真回答——因为 Agent 这个概念并不新(1990 年代就有),但直到 2023-2024 年才真正爆发。原因很简单:以前没有足够聪明的大脑。
timeline
title Agent 发展简史
1990s : 早期智能体研究 : 规则驱动,能力极弱
2016 : AlphaGo : 单一领域的超强 Agent
2022 : ChatGPT 发布 : LLM 证明了「通用智能」的可能
2023 : AutoGPT / BabyAGI : 第一个真正意义上的 LLM Agent
2024 : Claude Code / Devin / Cursor : Agent 进入生产环境
2025 : MCP 协议标准化 : Agent 工具调用的「USB 接口」2023 年之前:有 Agent 的构想,没有 Agent 的大脑
1990 年代的智能体研究主要靠手写规则——告诉 Agent「在 X 情况下做 Y」。问题是世界太复杂,手写规则覆盖不了万分之一。这些 Agent 只能在极其狭窄的领域(比如下棋、简单的物流调度)里用。
2016 年的 AlphaGo 是一个里程碑——它在围棋这个单一领域里展现出了「超越人类」的 Agent 能力。但 AlphaGo 出不了围棋棋盘。
2023 年:LLM 让 Agent 有了「通用大脑」
ChatGPT 的出现改变了游戏规则。人们突然发现:这个「只会聊天」的东西似乎有相当强的推理能力——它能理解模糊指令、能拆解任务、甚至能承认自己不知道某件事。
于是有人想:如果把 LLM 当成 Agent 的「大脑」,让它来决策「下一步该做什么」——行不行?
2023 年 4 月,AutoGPT 和 BabyAGI 横空出世。这两个项目做的事情本质上一样:把 LLM 放进一个循环里——「目标是什么 → 思考下一步 → 执行 → 观察结果 → 再思考」。虽然当时的版本可靠性很差(经常在循环里鬼打墙),但证明了这条路走得通。
2024-2025 年:Agent 走向工程化
接下来发生的事情很快:
- Claude 的 Tool Use 和 Computer Use:Anthropic 把工具调用和屏幕操作能力直接训练进了模型,Agent 不再是「提示词技巧」,而是模型的原生能力。
- OpenAI 的 GPTs 和 Assistants API:把 Agent 封装成了产品,非开发者也能用。
- Function Calling 成为标配:几乎每一家大模型都支持了标准化的函数调用。
- MCP(Model Context Protocol):Anthropic 在 2024 年底开源了 MCP——一个 Agent 与外部工具/数据源通信的标准协议。它相当于 Agent 世界的「USB-C 接口」:任何工具只要实现了 MCP,任何 Agent 就能直接调用。
- Devin、Cursor、Claude Code:Agent 产品开始真正干活——写代码、修 bug、部署服务——不只是 demo 了。
1.6 你已经每天都在用 Agent 了
你可能觉得 Agent 是个未来概念——其实你已经在用了。举几个例子:
| 产品 | Agent 能力体现 | 你用它干了什么 |
|---|---|---|
| Claude Code | 读代码库 → 理解结构 → 编辑文件 → 运行测试 → 根据测试结果修改 | 修 bug、加功能、重构代码——像一个和你 pair programming 的工程师 |
| Cursor | 索引整个代码库 → 理解上下文 → 在正确的位置写正确的代码 | 写代码时它不只是补全——它能理解整个项目 |
| ChatGPT Deep Research | 理解问题 → 搜索数十个网页 → 交叉验证 → 生成带引用的研究报告 | 做调研时不用自己翻几十个网页了 |
| Devin | 理解需求 → 写代码 → 测试 → 部署 → 修 bug | 像一个能独立完成开发任务的初级工程师 |
| Perplexity | 理解问题 → 搜索 → 对比来源 → 生成带引用答案 | 搜索不再是返回链接列表——而是给你结构化答案 |
1.7 Agent 的能力边界:现在到哪了
说完了乐观的,也要诚实地说说现在的局限。
flowchart TB
subgraph 当前能做到
A1[简单多步任务:搜索→汇总→格式化]
A2[代码生成与修改]
A3[文档写作与润色]
A4[数据提取与结构化]
end
subgraph 有时能做到
B1[复杂多步任务:调研→分析→报告→PPT]
B2[端到端项目开发]
B3[自主决策与纠错]
end
subgraph 还做不到或很不稳定
C1[超过50步的长链任务]
C2[需要「常识判断」的决策]
C3[零监督下的高风险操作]
C4[真正创造新知识]
end一个诚实的数据:目前最好的 Agent 在超过 10 步的任务中,成功率会骤降到 50% 以下。 每一步 90% 的正确率,乘 10 次就是
本章小结
| 要点 | 一句话 |
|---|---|
| LLM vs Agent | LLM 只会说,Agent 能干——多了一个「行动-观察-再思考」的循环 |
| Agent 核心循环 | 感知 → 思考 → 行动 → 观察 → 再思考 |
| 四项核心能力 | 感知(看)、规划(想)、执行(做)、记忆(记住) |
| 为什么现在才火 | 以前没有足够聪明的「大脑」;2023 年 LLM 成熟后才有了 |
| 你已经在了 | Claude Code、Cursor、Claudian——都是 Agent |
| 当前局限 | 长链任务可靠性低,每步 90% 正确率 → 10 步只剩 35% |
下一章预告
现在你知道了 Agent 是什么,也知道了它和普通 LLM 的根本区别。下一章我们拆开 Agent 的外壳,看看里面到底长什么样——它的「大脑」「手脚」「记忆」是怎么协同工作的。ReAct 是什么?Agent 怎么把一个模糊的「帮我做市场调研」拆成可执行的任务链?
| ← 上一章 | 回到目录 | 下一章 → |
|---|---|---|
| 目录 | 第2章:大脑、手脚与记忆 |