第1章:AI 到底是个啥
本章解决的核心问题:AI 到底是什么?它和传统计算机程序有什么区别?为什么 AI 在最近十年突然爆发了?读完这一章,你能在饭桌上给别人讲清楚 AI 的来龙去脉。
1.1 先定义问题:什么是「智能」
在回答「什么是人工智能」之前,我们得先面对一个更难的问题:什么是智能?
这个问题哲学家吵了两千多年,至今没有统一的答案。但我们可以用几个具体的场景来感受一下「智能」到底意味着什么:
- 你看到地上有一滩水,立刻绕过去——这叫感知和反应。
- 你学骑自行车,摔了三次之后学会了——这叫从经验中学习。
- 别人对你说「今天真热」,你能推断出他可能想让你开空调——这叫理解隐含意图。
- 你在陌生的城市里找到了回酒店的路——这叫推理和规划。
- 你知道「水在零度以下会结冰」——这叫拥有知识,但你也能理解「火星上的水在零度以下可能直接升华」——这叫灵活运用知识。
把这些能力打包在一起,大概就是人类期待的「智能」:感知环境、学习经验、理解意图、推理规划、灵活运用知识的综合体。
而人工智能的核心野心,无非是:让机器也拥有这些能力——哪怕只是部分拥有。
1.2 一场假装游戏:图灵测试
1950 年,英国数学家艾伦·图灵(Alan Turing)发表了一篇论文《Computing Machinery and Intelligence》,一开篇就问了一个石破天惊的问题:「机器能思考吗?」
图灵很聪明,他知道「思考」太难定义了,所以他不回答这个问题。他换了一个更可操作的问题,设计了一个游戏——后来被称为图灵测试。
游戏规则很简单:
flowchart LR
A[人类裁判] -->|打字提问| B[隔墙]
B -->|回答 A| C[真人]
B -->|回答 B| D[机器]- 一个人类裁判坐在隔墙的一侧,通过打字(当时是电传打字机)和墙另一侧的两个对象对话。
- 两个对象中,一个是真人,一个是机器。
- 裁判可以问任何问题,聊任何话题。
- 如果裁判无法可靠地区分哪个是真人、哪个是机器,那么这台机器就通过了图灵测试。
关键洞察:图灵测试不关心机器「内部怎么运作」——不要求它像人脑一样思考,不要求它有意识。它只看外部行为:你能不能分辨出来对面不是人?
这个思路影响至今。今天市面上几乎所有 AI 产品——ChatGPT、Claude、文心一言——都没「意识」,但它们的行为表现足以让我们觉得在和「智能体」对话。
图灵测试的局限
图灵测试也有争议。一个著名的反驳是中文屋实验(约翰·塞尔,1980):
想象一个不懂中文的人被关在一间屋子里,屋子里有一本巨大的规则手册。外面的人从门缝递进来中文纸条。屋里的人虽然不认识汉字,但他对照规则手册,找到对应的符号,照猫画虎地写下回复递出去。外面的人收到回复,觉得屋里的人中文很好。
问题来了:屋里的人「理解」中文吗?
中文屋实验想说的是:看起来聪明 ≠ 真正理解。这也是今天对 AI 的核心争论之一——它究竟是「理解」了你说的话,还是只是做了极其复杂的模式匹配?我们会在第5章讨论「幻觉」时再回到这个话题。
1.3 极简 AI 史:三次高潮,两次寒冬
AI 的历史不是一条直线的进步,而是起起落落的过山车。了解这段历史很重要,因为今天我们看到的一切(ChatGPT、自动驾驶、AI 画画)都不是凭空冒出来的——种子在几十年前就埋下了。
timeline
title AI 发展简史
1956 : 达特茅斯会议 : 「人工智能」诞生
1966 : 第一次 AI 寒冬 : 期望过高,算力不足
1980 : 专家系统热潮 : 规则驱动的商业应用
1987 : 第二次 AI 寒冬 : 专家系统崩溃
2012 : AlexNet 问世 : 深度学习元年
2017 : Transformer 论文 : 「Attention Is All You Need」
2022 : ChatGPT 发布 : 生成式 AI 爆发第一波:符号主义(1956-1974)
1956 年的达特茅斯会议是公认的「AI 生日」。一群顶尖科学家——麦卡锡、明斯基、香农、纽厄尔——聚在一起,自信满满地认为:用逻辑和规则就能实现智能。他们写程序时的方式是手写规则:「如果看到红灯,就停车」「如果是猫科动物且有黑色条纹,就是老虎」。
这个思路叫符号主义(Symbolic AI),核心假设是:智能 = 符号操作。就像数学推导一样,给定公理和推理规则,就能推出结论。
问题出在哪? 现实世界太复杂了。你能写出「识别猫」所需要的全部规则吗?猫有四条腿——但有的猫少了一条。猫有尾巴——但暹罗猫的尾巴有时候看不出。猫有胡须——但有的图片里胡须被挡住了。每一条规则都有无穷无尽的例外。
加上当时的计算机算力和现在的一部智能手机比起来都是九牛一毛,很多论文里的想法根本跑不动。1973 年,英国政府的《莱特希尔报告》判定 AI 研究「没有兑现承诺」,资金被砍——第一次 AI 寒冬来了。
第二波:专家系统(1980-1987)
1980 年代,一种新的 AI 范式火了起来:专家系统。这本质上还是手写规则,但变得更务实了——限制在一个狭窄的专业领域里,找领域专家把知识写成「如果...那么...」规则,装进计算机。
一个经典的例子是 MYCIN 系统(1976 年),它可以诊断某些血液传染病,开抗生素处方的准确率据说超过了初级医生。
商业上出现了热潮,企业纷纷成立 AI 部门。到 1985 年,AI 产业已经投入了超过 10 亿美元。
又出什么问题了? 专家系统有两大死穴:
- 知识获取瓶颈:找专家把知识写出来极其费时、费钱,还经常发现专家自己也说不清自己是怎么做判断的。
- 极其脆弱:一超出预设领域,系统完全抓瞎。一个诊断血液病的专家系统不可能诊断皮肤病。
1987 年,专用的 Lisp 机器市场崩溃,AI 投资急剧萎缩——第二次 AI 寒冬降临。
第三波:深度学习(2012-至今)
这次,AI 终于没有按照「手写规则」的路子走了。取而代之的是一条截然不同的思路:让机器自己从数据里学。
这条路的理论基础其实早就有了——神经网络的数学框架在 1980 年代基本成型,反向传播算法(这是训练神经网络的关键)在 1986 年就发表了。但当时缺两样东西:
- 缺数据:那时候没有互联网,没有海量的图片和文本用来训练。
- 缺算力:训练一个像样的神经网络所需要的计算量,当时的硬件根本扛不住。
到了 2010 年代,三件事凑齐了:
| 条件 | 怎么凑齐的 |
|---|---|
| 大数据 | 互联网产生了天文数字的文本、图片、视频;ImageNet 这样的大规模标注数据集出现了 |
| 大算力 | GPU(显卡)被证明特别适合神经网络的矩阵运算,NVIDIA 把游戏显卡变成了 AI 加速器 |
| 好算法 | 深度学习的训练技巧持续改进:更好的激活函数(ReLU)、正则化(Dropout)、优化器(Adam) |
2012 年是一个标志性的年份。多伦多大学的 Alex Krizhevsky 用一块 NVIDIA GPU 训练了一个叫 AlexNet 的神经网络,在 ImageNet 图像识别比赛中碾压了所有传统方法。从那一刻起,整个 AI 领域开始向深度学习倾斜。
flowchart LR
A[大数据] --> D[深度学习爆发]
B[大算力] --> D
C[好算法] --> D之后的故事大家就比较熟了:
- 2014:生成对抗网络(GAN)诞生,AI 开始「创造」图像。
- 2017:Google 发表《Attention Is All You Need》,提出了 Transformer 架构——今天所有大模型的祖宗。
- 2018:OpenAI 发布 GPT-1,Google 发布 BERT。大语言模型时代开启。
- 2020:GPT-3 横空出世,1750 亿参数,让世界看到了「规模的力量」。
- 2022:ChatGPT 发布,两个月内月活用户破亿。AI 从实验室走进了每个人的手机。
1.4 一张地图:AI 的层级关系
到这里我们必须画一张地图。因为媒体把所有东西都叫「AI」,这导致了巨大的混淆。
flowchart TB
AI[人工智能 AI
Artificial Intelligence]
ML[机器学习 ML
Machine Learning]
DL[深度学习 DL
Deep Learning]
LLM[大语言模型 LLM
Large Language Model]
GenAI[生成式 AI
Generative AI]
AI --> ML
AI --> Rule[基于规则的系统
专家系统等]
ML --> DL
ML --> TradML[传统机器学习
决策树、SVM 等]
DL --> LLM
DL --> CV[计算机视觉]
DL --> Speech[语音识别]
LLM --> GenAI这张图的意思是这样的:
人工智能(AI)是最大的圈
只要是用计算机模拟人类智能的,都叫 AI。超市收银系统里能识别商品条码的——算 AI;Siri 能听懂「明天上午九点叫我起床」——算 AI;深蓝下国际象棋赢了卡斯帕罗夫(1997 年)——也算 AI。
AI 是一个目标,不是一个方法。实现 AI 有多条路径。
机器学习(ML)是 AI 的一个子集
在机器学习出现之前,AI 主要靠手写规则(符号主义路线)。机器学习的核心思想完全不同:不给机器写规则,而是给机器数据和答案,让它自己找出规则。
举个例子。你要做一个识别猫的程序:
- 传统方法(符号主义):你写一堆规则——「耳朵是三角形的」「身体覆盖毛」「有四条腿」……然后把图像输入,程序逐条规则匹配。
- 机器学习方法:你给它一万张带标签的猫照片(「这是猫」)和一万张不带猫的照片(「这不是猫」),让算法自己学什么特征是「猫」。
机器学习不靠你告诉它规则——规则是它自己从数据里「学」出来的。
深度学习(DL)是 ML 的一个子集
深度学习用的是多层人工神经网络。这个「深」字,指的就是网络的层数多。我们会在第2章详细拆解,这里先打一个比喻:
如果把传统机器学习比作一个厨师照着你的菜谱炒菜,那深度学习就是一个厨师吃了十万道菜后,自己能发明新菜谱——而且有时候比人类厨师做的还好吃。
深度学习的突破在于:它能从原始数据中自动提取「特征」。传统机器学习需要人类手工设计特征(比如「图片中猫的耳朵应该是什么形状」),深度学习能自己一层一层地抽象出越来越高级的特征。
大语言模型(LLM)是 DL 的一个子集
LLM 就是 ChatGPT、Claude、文心一言这类「对话 AI」背后的技术。它本质上是深度学习中一种特定架构(Transformer)被放大到极致后的产物。
「大」就是字面意思——参数多、数据多、计算多。GPT-3 有 1750 亿个参数,GPT-4 的参数量未公布但据传在万亿级别。我们在第2章会讲「参数」到底是什么。
生成式 AI(GenAI)和 LLM 有重叠但不相等
生成式 AI 指的是能「创造内容」的 AI——生成文本、图片、音乐、视频、代码。ChatGPT 是文本生成式 AI,Midjourney 是图片生成式 AI,Suno 是音乐生成式 AI。
注意:LLM 可以不是生成式的(比如早期的 BERT 只做分类和理解),生成式 AI 也可以不是 LLM(比如图片生成的扩散模型不属于 LLM)。但在今天大众语境里,这两个词经常混着用——ChatGPT 同时是 LLM 也是生成式 AI。
1.5 传统程序 vs 机器学习:一个对比帮你彻底搞清楚
这是整章最重要的一个对比。如果你只能记住一件事,记住这个就行。
| 维度 | 传统程序 | 机器学习 |
|---|---|---|
| 核心逻辑 | 人写规则,程序执行规则 | 人给数据,程序从数据中学规则 |
| 输入 | 数据 + 规则 | 数据 + 答案(标签) |
| 输出 | 结果 | 规则(模型) |
| 举个栗子 | 「如果气温 > 30°C 且湿度 > 70%,提醒用户带伞」 | 给模型一千天的天气数据和一千天「用户是否带伞」的记录,模型自己学出规律 |
| 适合什么 | 规则明确的场景(如计算工资、银行转账) | 规则模糊的场景(如识别图片、理解语言) |
| 遇到例外 | 程序崩溃或给出莫名其妙的结果 | 有时对有时错,取决于训练数据的覆盖度 |
用一个直观的图:
flowchart LR
subgraph traditional[传统程序]
T1[数据] --> T3[程序(规则)]
T2[规则] --> T3
T3 --> T4[结果]
end
subgraph ml[机器学习]
M1[数据] --> M3[算法]
M2[答案] --> M3
M3 --> M4[模型(学到的规则)]
end传统程序:你把规则写死在代码里。程序不会「进步」,除非你修改代码。
机器学习:你给模型的是「例题和答案」,让它自己总结出「解题方法」。以后它碰到没见过的题,用总结出的方法去解。这个「解题方法」就是模型——本质上是训练得到的参数。模型可以不断用新数据改进。
1.6 为什么 AI 偏偏是现在爆发了
如果深度学习理论在 1980 年代就有了,为什么等到 2010 年代才爆发?答案是三个变量同时到达了临界点:
1. 数据:互联网制造了史上最大的「训练集」
ImageNet(2009 年发布)有超过 1400 万张人工标注的图片。Common Crawl(互联网抓取)有数十亿网页的文本。Wikipedia、GitHub、Reddit、Stack Overflow——所有这些平台积累的内容,都成了训练模型的「饲料」。
没有互联网,就没有大模型。这是一个直接的因果关系。
2. 算力:GPU 的革命
我们会在第4章详细讲,这里只说结论:
- CPU(中央处理器) 像一群博士——每个都很聪明,但只有几个人,适合做逻辑复杂的串行任务。
- GPU(图形处理器) 像几千个小学生——每个人只会做简单的加减乘除,但人多,适合做大量并行的简单计算。
神经网络的训练恰好就是「大量并行的简单计算」——矩阵乘法。GPU 天生适合干这个。NVIDIA 从 2006 年 CUDA 发布开始,逐渐把 GPU 从游戏显卡变成了 AI 从业者不可或缺的工具。到今天,NVIDIA 的市值已经突破了 3 万亿美元,很大程度上就是因为它卡住了 AI 算力的命脉。
3. 算法:几个关键突破
即使是深度学习的复兴也有几个关键的技术节点:
- ReLU 激活函数(2010 年前后广泛采用):解决了深层网络「梯度消失」的问题,让网络可以做得更深。
- Dropout 正则化(2012):训练时随机「关掉」一些神经元,防止模型死记硬背(过拟合)。
- Batch Normalization(2015):让训练更稳定、更快。
- ResNet 残差网络(2015):152 层的网络也能有效训练,直接把图像识别精度推上新高度。
- Transformer 架构(2017):这可能是 2010 年代最重要的 AI 论文。它用「注意力机制」取代了之前循环神经网络(RNN)的串行处理方式,让模型可以并行处理整个序列,并且能够捕捉长距离的依赖关系。GPT、BERT、Claude、文心一言——全都基于 Transformer。
1.7 一条非常重要的分界线:窄 AI vs 通用 AI
最后我们必须区分两个概念,这两个概念被大量混用,造成了极大的误解。
窄 AI(Narrow AI / Weak AI)
**所有的现有 AI 都是窄 AI。**无一例外。
窄 AI 只能在特定的、限定的任务上表现出色。AlphaGo 能下围棋赢世界冠军,但它不会泡咖啡。ChatGPT 能写诗写文章,但它没有真实的「意图」和「感受」。自动驾驶系统能识别行人避让,但它理解不了「为什么这个行人看起来心情不好」。
窄 AI 不是「弱智」——它是「范围窄」。 在它擅长的领域里,它可以远超人类。但在领域之外,它什么都不是。
通用 AI(AGI / Artificial General Intelligence)
AGI 指的是能像人类一样在任何智力任务上都表现良好的人工智能。一个 AGI 应该能:看一篇文章后写读后感、解一道数学题、学一项新技能、理解一个笑话为什么好笑、在陌生环境中自己找出解决问题的方法。
**AGI 目前还不存在。**关于它什么时候会实现,业内分歧极大:
- 有人觉得 5-10 年内(如 OpenAI 的萨姆·奥特曼、Anthropic 的达里奥·阿莫迪)。
- 有人觉得至少还要几十年(如 Meta 的杨立昆)。
- 还有人说大语言模型这条路根本不可能通向 AGI(也是杨立昆的观点)。
你只需要知道一件事:今天我们谈论的所有 AI 产品都是窄 AI。「AGI 来了」是营销话术,不是技术事实。
本章小结
| 要点 | 一句话 |
|---|---|
| 智能是什么 | 感知、学习、推理、理解、规划的综合体——没有统一定义,但有公认的方向 |
| 图灵测试 | 不看「内部怎么想」,只看「行为像不像人」——影响至今 |
| AI 层级 | AI ⊃ ML ⊃ DL ⊃ LLM,大语言模型只是 AI 大树的一枝 |
| 传统 vs ML | 传统是「人写规则」,ML 是「人给数据,模型找规则」 |
| 为什么现在爆发 | 数据(互联网)+ 算力(GPU)+ 算法(Transformer)= 临界点 |
| 窄 AI vs AGI | 所有现有 AI 都是窄 AI;AGI 还是科幻 |
下一章预告
现在你知道了 AI 在整个技术版图里的位置,也知道了传统程序和机器学习的区别。下一章我们会钻进去,看看那个风头最劲的东西——大语言模型——到底是什么。
我们将回答:什么是「参数」?神经网络长什么样?1750 亿个参数意味着什么?一个模型是怎么从一堆文本里「学到」东西的?
| ← 上一章 | 回到目录 | 下一章 → |
|---|---|---|
| 目录 | 第2章:大模型是什么 |