第1章:AI 到底是个啥

本章解决的核心问题:AI 到底是什么?它和传统计算机程序有什么区别?为什么 AI 在最近十年突然爆发了?读完这一章,你能在饭桌上给别人讲清楚 AI 的来龙去脉。


1.1 先定义问题:什么是「智能」

在回答「什么是人工智能」之前,我们得先面对一个更难的问题:什么是智能?

这个问题哲学家吵了两千多年,至今没有统一的答案。但我们可以用几个具体的场景来感受一下「智能」到底意味着什么:

把这些能力打包在一起,大概就是人类期待的「智能」:感知环境、学习经验、理解意图、推理规划、灵活运用知识的综合体。

而人工智能的核心野心,无非是:让机器也拥有这些能力——哪怕只是部分拥有。


1.2 一场假装游戏:图灵测试

1950 年,英国数学家艾伦·图灵(Alan Turing)发表了一篇论文《Computing Machinery and Intelligence》,一开篇就问了一个石破天惊的问题:「机器能思考吗?」

图灵很聪明,他知道「思考」太难定义了,所以他不回答这个问题。他换了一个更可操作的问题,设计了一个游戏——后来被称为图灵测试

游戏规则很简单:

flowchart LR
    A[人类裁判] -->|打字提问| B[隔墙]
    B -->|回答 A| C[真人]
    B -->|回答 B| D[机器]

关键洞察:图灵测试不关心机器「内部怎么运作」——不要求它像人脑一样思考,不要求它有意识。它只看外部行为:你能不能分辨出来对面不是人?

这个思路影响至今。今天市面上几乎所有 AI 产品——ChatGPT、Claude、文心一言——都没「意识」,但它们的行为表现足以让我们觉得在和「智能体」对话。

图灵测试的局限

图灵测试也有争议。一个著名的反驳是中文屋实验(约翰·塞尔,1980):

想象一个不懂中文的人被关在一间屋子里,屋子里有一本巨大的规则手册。外面的人从门缝递进来中文纸条。屋里的人虽然不认识汉字,但他对照规则手册,找到对应的符号,照猫画虎地写下回复递出去。外面的人收到回复,觉得屋里的人中文很好。

问题来了:屋里的人「理解」中文吗?

中文屋实验想说的是:看起来聪明 ≠ 真正理解。这也是今天对 AI 的核心争论之一——它究竟是「理解」了你说的话,还是只是做了极其复杂的模式匹配?我们会在第5章讨论「幻觉」时再回到这个话题。


1.3 极简 AI 史:三次高潮,两次寒冬

AI 的历史不是一条直线的进步,而是起起落落的过山车。了解这段历史很重要,因为今天我们看到的一切(ChatGPT、自动驾驶、AI 画画)都不是凭空冒出来的——种子在几十年前就埋下了。

timeline
    title AI 发展简史
    1956 : 达特茅斯会议 : 「人工智能」诞生
    1966 : 第一次 AI 寒冬 : 期望过高,算力不足
    1980 : 专家系统热潮 : 规则驱动的商业应用
    1987 : 第二次 AI 寒冬 : 专家系统崩溃
    2012 : AlexNet 问世 : 深度学习元年
    2017 : Transformer 论文 : 「Attention Is All You Need」
    2022 : ChatGPT 发布 : 生成式 AI 爆发

第一波:符号主义(1956-1974)

1956 年的达特茅斯会议是公认的「AI 生日」。一群顶尖科学家——麦卡锡、明斯基、香农、纽厄尔——聚在一起,自信满满地认为:用逻辑和规则就能实现智能。他们写程序时的方式是手写规则:「如果看到红灯,就停车」「如果是猫科动物且有黑色条纹,就是老虎」。

这个思路叫符号主义(Symbolic AI),核心假设是:智能 = 符号操作。就像数学推导一样,给定公理和推理规则,就能推出结论。

问题出在哪? 现实世界太复杂了。你能写出「识别猫」所需要的全部规则吗?猫有四条腿——但有的猫少了一条。猫有尾巴——但暹罗猫的尾巴有时候看不出。猫有胡须——但有的图片里胡须被挡住了。每一条规则都有无穷无尽的例外。

加上当时的计算机算力和现在的一部智能手机比起来都是九牛一毛,很多论文里的想法根本跑不动。1973 年,英国政府的《莱特希尔报告》判定 AI 研究「没有兑现承诺」,资金被砍——第一次 AI 寒冬来了。

第二波:专家系统(1980-1987)

1980 年代,一种新的 AI 范式火了起来:专家系统。这本质上还是手写规则,但变得更务实了——限制在一个狭窄的专业领域里,找领域专家把知识写成「如果...那么...」规则,装进计算机。

一个经典的例子是 MYCIN 系统(1976 年),它可以诊断某些血液传染病,开抗生素处方的准确率据说超过了初级医生。

商业上出现了热潮,企业纷纷成立 AI 部门。到 1985 年,AI 产业已经投入了超过 10 亿美元。

又出什么问题了? 专家系统有两大死穴:

  1. 知识获取瓶颈:找专家把知识写出来极其费时、费钱,还经常发现专家自己也说不清自己是怎么做判断的。
  2. 极其脆弱:一超出预设领域,系统完全抓瞎。一个诊断血液病的专家系统不可能诊断皮肤病。

1987 年,专用的 Lisp 机器市场崩溃,AI 投资急剧萎缩——第二次 AI 寒冬降临。

第三波:深度学习(2012-至今)

这次,AI 终于没有按照「手写规则」的路子走了。取而代之的是一条截然不同的思路:让机器自己从数据里学

这条路的理论基础其实早就有了——神经网络的数学框架在 1980 年代基本成型,反向传播算法(这是训练神经网络的关键)在 1986 年就发表了。但当时缺两样东西:

到了 2010 年代,三件事凑齐了:

条件 怎么凑齐的
大数据 互联网产生了天文数字的文本、图片、视频;ImageNet 这样的大规模标注数据集出现了
大算力 GPU(显卡)被证明特别适合神经网络的矩阵运算,NVIDIA 把游戏显卡变成了 AI 加速器
好算法 深度学习的训练技巧持续改进:更好的激活函数(ReLU)、正则化(Dropout)、优化器(Adam)

2012 年是一个标志性的年份。多伦多大学的 Alex Krizhevsky 用一块 NVIDIA GPU 训练了一个叫 AlexNet 的神经网络,在 ImageNet 图像识别比赛中碾压了所有传统方法。从那一刻起,整个 AI 领域开始向深度学习倾斜。

flowchart LR
    A[大数据] --> D[深度学习爆发]
    B[大算力] --> D
    C[好算法] --> D

之后的故事大家就比较熟了:


1.4 一张地图:AI 的层级关系

到这里我们必须画一张地图。因为媒体把所有东西都叫「AI」,这导致了巨大的混淆。

flowchart TB
    AI[人工智能 AI
Artificial Intelligence] ML[机器学习 ML
Machine Learning] DL[深度学习 DL
Deep Learning] LLM[大语言模型 LLM
Large Language Model] GenAI[生成式 AI
Generative AI] AI --> ML AI --> Rule[基于规则的系统
专家系统等] ML --> DL ML --> TradML[传统机器学习
决策树、SVM 等] DL --> LLM DL --> CV[计算机视觉] DL --> Speech[语音识别] LLM --> GenAI

这张图的意思是这样的

人工智能(AI)是最大的圈

只要是用计算机模拟人类智能的,都叫 AI。超市收银系统里能识别商品条码的——算 AI;Siri 能听懂「明天上午九点叫我起床」——算 AI;深蓝下国际象棋赢了卡斯帕罗夫(1997 年)——也算 AI。

AI 是一个目标,不是一个方法。实现 AI 有多条路径。

机器学习(ML)是 AI 的一个子集

在机器学习出现之前,AI 主要靠手写规则(符号主义路线)。机器学习的核心思想完全不同:不给机器写规则,而是给机器数据和答案,让它自己找出规则

举个例子。你要做一个识别猫的程序:

机器学习不靠你告诉它规则——规则是它自己从数据里「学」出来的。

深度学习(DL)是 ML 的一个子集

深度学习用的是多层人工神经网络。这个「深」字,指的就是网络的层数多。我们会在第2章详细拆解,这里先打一个比喻:

如果把传统机器学习比作一个厨师照着你的菜谱炒菜,那深度学习就是一个厨师吃了十万道菜后,自己能发明新菜谱——而且有时候比人类厨师做的还好吃。

深度学习的突破在于:它能从原始数据中自动提取「特征」。传统机器学习需要人类手工设计特征(比如「图片中猫的耳朵应该是什么形状」),深度学习能自己一层一层地抽象出越来越高级的特征。

大语言模型(LLM)是 DL 的一个子集

LLM 就是 ChatGPT、Claude、文心一言这类「对话 AI」背后的技术。它本质上是深度学习中一种特定架构(Transformer)被放大到极致后的产物。

「大」就是字面意思——参数多、数据多、计算多。GPT-3 有 1750 亿个参数,GPT-4 的参数量未公布但据传在万亿级别。我们在第2章会讲「参数」到底是什么。

生成式 AI(GenAI)和 LLM 有重叠但不相等

生成式 AI 指的是能「创造内容」的 AI——生成文本、图片、音乐、视频、代码。ChatGPT 是文本生成式 AI,Midjourney 是图片生成式 AI,Suno 是音乐生成式 AI。

注意:LLM 可以不是生成式的(比如早期的 BERT 只做分类和理解),生成式 AI 也可以不是 LLM(比如图片生成的扩散模型不属于 LLM)。但在今天大众语境里,这两个词经常混着用——ChatGPT 同时是 LLM 也是生成式 AI。


1.5 传统程序 vs 机器学习:一个对比帮你彻底搞清楚

这是整章最重要的一个对比。如果你只能记住一件事,记住这个就行。

维度 传统程序 机器学习
核心逻辑 人写规则,程序执行规则 人给数据,程序从数据中学规则
输入 数据 + 规则 数据 + 答案(标签)
输出 结果 规则(模型)
举个栗子 「如果气温 > 30°C 且湿度 > 70%,提醒用户带伞」 给模型一千天的天气数据和一千天「用户是否带伞」的记录,模型自己学出规律
适合什么 规则明确的场景(如计算工资、银行转账) 规则模糊的场景(如识别图片、理解语言)
遇到例外 程序崩溃或给出莫名其妙的结果 有时对有时错,取决于训练数据的覆盖度

用一个直观的图:

flowchart LR
    subgraph traditional[传统程序]
        T1[数据] --> T3[程序(规则)]
        T2[规则] --> T3
        T3 --> T4[结果]
    end
    subgraph ml[机器学习]
        M1[数据] --> M3[算法]
        M2[答案] --> M3
        M3 --> M4[模型(学到的规则)]
    end

传统程序:你把规则写死在代码里。程序不会「进步」,除非你修改代码。

机器学习:你给模型的是「例题和答案」,让它自己总结出「解题方法」。以后它碰到没见过的题,用总结出的方法去解。这个「解题方法」就是模型——本质上是训练得到的参数。模型可以不断用新数据改进。


1.6 为什么 AI 偏偏是现在爆发了

如果深度学习理论在 1980 年代就有了,为什么等到 2010 年代才爆发?答案是三个变量同时到达了临界点:

1. 数据:互联网制造了史上最大的「训练集」

ImageNet(2009 年发布)有超过 1400 万张人工标注的图片。Common Crawl(互联网抓取)有数十亿网页的文本。Wikipedia、GitHub、Reddit、Stack Overflow——所有这些平台积累的内容,都成了训练模型的「饲料」。

没有互联网,就没有大模型。这是一个直接的因果关系。

2. 算力:GPU 的革命

我们会在第4章详细讲,这里只说结论:

神经网络的训练恰好就是「大量并行的简单计算」——矩阵乘法。GPU 天生适合干这个。NVIDIA 从 2006 年 CUDA 发布开始,逐渐把 GPU 从游戏显卡变成了 AI 从业者不可或缺的工具。到今天,NVIDIA 的市值已经突破了 3 万亿美元,很大程度上就是因为它卡住了 AI 算力的命脉。

3. 算法:几个关键突破

即使是深度学习的复兴也有几个关键的技术节点:


1.7 一条非常重要的分界线:窄 AI vs 通用 AI

最后我们必须区分两个概念,这两个概念被大量混用,造成了极大的误解。

窄 AI(Narrow AI / Weak AI)

**所有的现有 AI 都是窄 AI。**无一例外。

窄 AI 只能在特定的、限定的任务上表现出色。AlphaGo 能下围棋赢世界冠军,但它不会泡咖啡。ChatGPT 能写诗写文章,但它没有真实的「意图」和「感受」。自动驾驶系统能识别行人避让,但它理解不了「为什么这个行人看起来心情不好」。

窄 AI 不是「弱智」——它是「范围窄」。 在它擅长的领域里,它可以远超人类。但在领域之外,它什么都不是。

通用 AI(AGI / Artificial General Intelligence)

AGI 指的是能像人类一样在任何智力任务上都表现良好的人工智能。一个 AGI 应该能:看一篇文章后写读后感、解一道数学题、学一项新技能、理解一个笑话为什么好笑、在陌生环境中自己找出解决问题的方法。

**AGI 目前还不存在。**关于它什么时候会实现,业内分歧极大:

你只需要知道一件事:今天我们谈论的所有 AI 产品都是窄 AI。「AGI 来了」是营销话术,不是技术事实。


本章小结

要点 一句话
智能是什么 感知、学习、推理、理解、规划的综合体——没有统一定义,但有公认的方向
图灵测试 不看「内部怎么想」,只看「行为像不像人」——影响至今
AI 层级 AI ⊃ ML ⊃ DL ⊃ LLM,大语言模型只是 AI 大树的一枝
传统 vs ML 传统是「人写规则」,ML 是「人给数据,模型找规则」
为什么现在爆发 数据(互联网)+ 算力(GPU)+ 算法(Transformer)= 临界点
窄 AI vs AGI 所有现有 AI 都是窄 AI;AGI 还是科幻

下一章预告

现在你知道了 AI 在整个技术版图里的位置,也知道了传统程序和机器学习的区别。下一章我们会钻进去,看看那个风头最劲的东西——大语言模型——到底是什么。

我们将回答:什么是「参数」?神经网络长什么样?1750 亿个参数意味着什么?一个模型是怎么从一堆文本里「学到」东西的?

第2章:大模型是什么


← 上一章 回到目录 下一章 →
目录 第2章:大模型是什么