第1章:Agent 到底是什么

本章解决的核心问题:AI Agent 和 ChatGPT 这种「聊天机器人」到底有什么本质区别?为什么 2024-2025 年所有人都在谈 Agent?读完这一章,你能在同事面前解释清楚「Agent 不是聊天软件——它是能替你干活的 AI」。


1.1 一个场景开始

assets/ai-agent-comics/ch01-01-llm-vs-agent.webp
🎨 漫画图解:〈同一个大脑,多了一双手〉

先想象两个场景。

场景 A:你打开 ChatGPT,输入「帮我写一份关于新能源汽车市场的报告」。几十秒后,ChatGPT 吐出一份结构完整、数据看起来像回事的报告。你读了一遍,发现有些数据是编的,于是又追问了几轮,最终得到了一份能用的初稿。

场景 B:你对一个 AI Agent 说同样的话。它没有立刻吐报告。它先搜索了最近三个月的新能源汽车新闻和行业报告,对比了多家数据源。它发现中汽协的官网有一份最新统计,于是自己打开了那个网页,提取了数据。然后它生成了一个 PPT,把图表嵌了进去,发到了你的邮箱。整个过程你只说了那一句话。

场景 A 和场景 B 的区别,就是大语言模型(LLM)和 AI Agent 之间的那条红线。

LLM(ChatGPT) AI Agent
能做什么 理解和生成文本 理解、规划、执行、验证
交互方式 你问一句,它答一句 你给目标,它自己拆步骤
能否使用工具 不能(除非插件) 核心能力
能否获取实时信息 不能(知识有时效) 能(可以自己搜索)
能否操作外部系统 不能 能(发邮件、写文件、调 API)
工作模式 一问一答 循环:思考 → 行动 → 观察 → 再思考

一句话总结:LLM 是一个知识渊博但困在聊天框里的人。Agent 是给他配了手机、电脑、银行卡、车钥匙之后的版本——不仅能聊,还能办事。


1.2 Agent 的经典定义:Sense → Think → Act

assets/ai-agent-comics/ch01-02-sense-think-act.webp
🎨 漫画图解:〈Agent 的行动循环〉

「Agent」这个词在 AI 领域其实很老了,不是新概念。早在 1990 年代,AI 研究者就已经在讨论「智能体」——能在环境中自主感知和行动的系统。

现代 AI Agent 的核心循环可以用三个词概括:

flowchart LR
    S[👁️ 感知
Sense] --> T[🧠 思考
Think] T --> A[🦾 行动
Act] A --> O[👁️ 观察
Observe] O --> T

这个循环翻译成人话:

  1. 感知(Sense):Agent 从环境中获取信息。环境可以是用户的输入、网页内容、API 返回的数据、文件内容——任何能被 Agent「看到」的东西。
  2. 思考(Think):Agent 分析当前状态,推理下一步该做什么。这个「思考」能力来自它的大脑——一个大语言模型。模型评估当前情况,决定一个行动计划。
  3. 行动(Act):Agent 执行决定——可能是在终端里跑一条命令、调用一个 API、打开一个网页、生成一段文本。
  4. 观察(Observe):Agent 检查行动的结果。成功了?失败了?结果是不是自己预期的?然后回到第 2 步,根据观察结果调整下一步。

这就是 Agent 和 LLM 最本质的区别:LLM 停在「思考」这一步。Agent 多了一个「行动-观察-再思考」的循环。 这多出来的一步,是质的飞跃。


1.3 一个生活化类比

为了帮你把这个概念焊死在脑子里,我讲一个故事。

想象一个叫小狗的年轻人。

小狗(LLM 版本):小狗从小被困在一个房间里,靠读书过活。他读完了世界上所有的书——百科全书、维基百科、学术论文、小说、技术文档——什么都读过。你问他任何问题,他都能引经据典地回答,有逻辑、有深度。

但他的房间没有窗户、没有门。你看不见他,他也看不见外面。他给不了你今天的气温,因为他不知道今天是几月几号。他帮你订不了机票,因为他的房间里没有电脑也没有手机。

小狗(Agent 版本):有一天,你给了小狗一部手机。

现在,当你问他「今天天气怎么样」,他不再依靠书本上「北京7月平均气温26度」这样的过时知识——他会打开手机上的天气应用,查一下实时数据,然后告诉你。

当你对他说「帮我和家人预订一家周六晚上的法餐厅」,他会:先查看你的日程(确认周六晚上有空),然后搜附近的法餐厅,逐家查看评分和是否有空位,挑出三个最佳选项发给你。等你选了之后,他自己打电话订座,然后把确认短信转发给你。

同一个「大脑」,多了一双「手」,它就从「图书馆管理员」变成了「私人助理」。

这个类比不是鸡汤,它是 AGI 研究者们真心相信的路线图:现有的 LLM 已经有足够的「智力」,缺的是和环境交互的「身体」。Agent 框架解决的就是这个问题。


1.4 Agent 的四个核心能力

assets/ai-agent-comics/ch01-03-four-abilities.webp
🎨 漫画图解:〈Agent 的四件装备〉

把 Sense-Think-Act 循环再拆细一点,一个合格的 Agent 需要四项核心能力:

mindmap
  root((Agent 核心能力))
    感知 Perception
      读取用户输入
      获取工具返回结果
      监控环境状态
    规划 Planning
      目标分解
      步骤排序
      资源评估
      备选方案
    执行 Execution
      调用工具/API
      写文件/发请求
      操作外部系统
    记忆 Memory
      短期:上下文窗口
      长期:向量数据库
      经验:成功/失败记录

感知(Perception)

Agent 的「感官」。输入可以是自然语言(用户说的)、结构化数据(API 返回的 JSON)、非结构化数据(网页内容、PDF 文档)、甚至是多模态输入(图片、音频)。

一个优秀的 Agent 不是被动地接收输入——它会主动去「感知」,比如自己去搜、自己去查、自己去验证。

规划(Planning)

这是 Agent 智力的核心体现。一个模糊的用户指令——「帮我做市场调研」——在 Agent 脑子里要变成一连串可执行的子任务:

  1. 确定调研的行业和范围
  2. 搜索近一年的行业报告
  3. 提取关键数据和趋势
  4. 对比主要竞品
  5. 生成结构化报告

在第2章我们会详细拆解 Agent 的规划机制——ReAct、思维链、思维树这些听着很酷的词到底是什么意思。

执行(Execution)

Agent 的手。工具调用是 Agent 和外部世界交互的唯一方式——不管是搜网页、调用 API、操作文件还是发邮件,底层都是「Agent 输出一个工具调用的请求,外部程序执行并返回结果」。第4章会完整拆解这个过程。

记忆(Memory)

人类做事靠记忆:你知道自己是谁、昨天干了什么、刚才查到了什么信息。Agent 也一样——如果没有记忆,它每说一句话都是「从零开始」,像一个永远在失忆的人。

Agent 的记忆分三层(第2章详讲):


1.5 为什么 Agent 是现在才火的

assets/ai-agent-comics/ch01-04-agent-history.webp
🎨 漫画图解:〈Agent 为什么现在才醒来〉

这个问题值得认真回答——因为 Agent 这个概念并不新(1990 年代就有),但直到 2023-2024 年才真正爆发。原因很简单:以前没有足够聪明的大脑。

timeline
    title Agent 发展简史
    1990s : 早期智能体研究 : 规则驱动,能力极弱
    2016 : AlphaGo : 单一领域的超强 Agent
    2022 : ChatGPT 发布 : LLM 证明了「通用智能」的可能
    2023 : AutoGPT / BabyAGI : 第一个真正意义上的 LLM Agent
    2024 : Claude Code / Devin / Cursor : Agent 进入生产环境
    2025 : MCP 协议标准化 : Agent 工具调用的「USB 接口」

2023 年之前:有 Agent 的构想,没有 Agent 的大脑

1990 年代的智能体研究主要靠手写规则——告诉 Agent「在 X 情况下做 Y」。问题是世界太复杂,手写规则覆盖不了万分之一。这些 Agent 只能在极其狭窄的领域(比如下棋、简单的物流调度)里用。

2016 年的 AlphaGo 是一个里程碑——它在围棋这个单一领域里展现出了「超越人类」的 Agent 能力。但 AlphaGo 出不了围棋棋盘。

2023 年:LLM 让 Agent 有了「通用大脑」

ChatGPT 的出现改变了游戏规则。人们突然发现:这个「只会聊天」的东西似乎有相当强的推理能力——它能理解模糊指令、能拆解任务、甚至能承认自己不知道某件事。

于是有人想:如果把 LLM 当成 Agent 的「大脑」,让它来决策「下一步该做什么」——行不行?

2023 年 4 月,AutoGPT 和 BabyAGI 横空出世。这两个项目做的事情本质上一样:把 LLM 放进一个循环里——「目标是什么 → 思考下一步 → 执行 → 观察结果 → 再思考」。虽然当时的版本可靠性很差(经常在循环里鬼打墙),但证明了这条路走得通。

2024-2025 年:Agent 走向工程化

接下来发生的事情很快:


1.6 你已经每天都在用 Agent 了

你可能觉得 Agent 是个未来概念——其实你已经在用了。举几个例子:

产品 Agent 能力体现 你用它干了什么
Claude Code 读代码库 → 理解结构 → 编辑文件 → 运行测试 → 根据测试结果修改 修 bug、加功能、重构代码——像一个和你 pair programming 的工程师
Cursor 索引整个代码库 → 理解上下文 → 在正确的位置写正确的代码 写代码时它不只是补全——它能理解整个项目
ChatGPT Deep Research 理解问题 → 搜索数十个网页 → 交叉验证 → 生成带引用的研究报告 做调研时不用自己翻几十个网页了
Devin 理解需求 → 写代码 → 测试 → 部署 → 修 bug 像一个能独立完成开发任务的初级工程师
Perplexity 理解问题 → 搜索 → 对比来源 → 生成带引用答案 搜索不再是返回链接列表——而是给你结构化答案

1.7 Agent 的能力边界:现在到哪了

说完了乐观的,也要诚实地说说现在的局限。

flowchart TB
    subgraph 当前能做到
        A1[简单多步任务:搜索→汇总→格式化]
        A2[代码生成与修改]
        A3[文档写作与润色]
        A4[数据提取与结构化]
    end
    subgraph 有时能做到
        B1[复杂多步任务:调研→分析→报告→PPT]
        B2[端到端项目开发]
        B3[自主决策与纠错]
    end
    subgraph 还做不到或很不稳定
        C1[超过50步的长链任务]
        C2[需要「常识判断」的决策]
        C3[零监督下的高风险操作]
        C4[真正创造新知识]
    end

一个诚实的数据:目前最好的 Agent 在超过 10 步的任务中,成功率会骤降到 50% 以下。 每一步 90% 的正确率,乘 10 次就是 0.910=35%。这是 Agent 面临的核心工程挑战——我们在第6章和第7章会反复回到这个话题。


本章小结

要点 一句话
LLM vs Agent LLM 只会说,Agent 能干——多了一个「行动-观察-再思考」的循环
Agent 核心循环 感知 → 思考 → 行动 → 观察 → 再思考
四项核心能力 感知(看)、规划(想)、执行(做)、记忆(记住)
为什么现在才火 以前没有足够聪明的「大脑」;2023 年 LLM 成熟后才有了
你已经在了 Claude Code、Cursor、Claudian——都是 Agent
当前局限 长链任务可靠性低,每步 90% 正确率 → 10 步只剩 35%

下一章预告

现在你知道了 Agent 是什么,也知道了它和普通 LLM 的根本区别。下一章我们拆开 Agent 的外壳,看看里面到底长什么样——它的「大脑」「手脚」「记忆」是怎么协同工作的。ReAct 是什么?Agent 怎么把一个模糊的「帮我做市场调研」拆成可执行的任务链?

第2章:大脑、手脚与记忆


← 上一章 回到目录 下一章 →
目录 第2章:大脑、手脚与记忆