第4章:算力 —— 大模型的燃料
本章解决的核心问题:大模型需要惊人的计算资源。算力是什么?GPU 凭什么比 CPU 更适合 AI?训练一个 GPT-4 级别的模型到底要花多少钱?推理和训练的算力需求有什么不同?读完这一章,你能看懂 AI 行业「军备竞赛」背后的技术逻辑。
4.1 算力的基本单位:从 FLOPs 开始
4.1.1 什么是 FLOPs
在讨论 GPU 和训练成本之前,我们需要一个衡量「计算量」的单位。
- FLOP = Floating-point Operation = 一次浮点运算(小数点的加减乘除)
- FLOPs = 浮点运算次数(加了 s 表示复数)
- FLOPS = Floating-point Operations Per Second = 每秒完成的浮点运算次数(加了 S 表示"每秒")
区分这三个写法很重要,但它们极易混淆——包括在专业论文里也经常混用。本教程中我们一律用:
- FLOPs 表示「计算总量」(比如训练 GPT-3 需要 3.14 × 10²³ 次浮点运算)
- FLOPS 表示「计算速度」(比如一块 H100 GPU 算力是 1979 TFLOPS)
4.1.2 量级的直觉
| 单位 | 全称 | 数量级 | 类比 |
|---|---|---|---|
| 1 FLOP | 一次浮点运算 | 1 | 一个人心算一次加法 |
| 1 GFLOP(千兆) | 10⁹ FLOPs | 10 亿 | 一部智能手机一秒钟的算力 |
| 1 TFLOP(兆) | 10¹² FLOPs | 1 万亿 | 一块高端 GPU 的算力 |
| 1 PFLOP(千兆) | 10¹⁵ FLOPs | 1000 万亿 | 一个小型数据中心的算力 |
| 1 EFLOP(百京) | 10¹⁸ FLOPs | 100 亿亿 | GPT-4 级别模型的训练算力 |
用一个更直观的比喻:如果一次浮点运算相当于一颗大米粒,那么训练 GPT-3(3.14 × 10²³ FLOPs)的大米粒体积大约相当于整个太平洋。
4.2 CPU vs GPU:卡车队与千帆竞渡
4.2.1 核心区别
flowchart TB
subgraph cpu[CPU 中央处理器]
C1[核心 1
超强]
C2[核心 2
超强]
C3[核心 3
超强]
C4[核心 4
超强]
end
subgraph gpu[GPU 图形处理器]
G1[核心 1] --- G2[核心 2] --- G3[核心 3] --- G4[...]
G5[核心 N-3] --- G6[核心 N-2] --- G7[核心 N-1] --- G8[核心 N]
end| 维度 | CPU | GPU |
|---|---|---|
| 核心数 | 几个到几十个 | 几千到上万个 |
| 单核心能力 | 极强(复杂逻辑、分支预测) | 较弱(只能做简单运算) |
| 擅长任务 | 串行任务(一个接着一个做) | 并行任务(几千个同时做) |
| 类比 | 博士团队(人少但精) | 小学生军团(人多但每人只会基础运算) |
| 典型用途 | 操作系统、数据库、游戏逻辑 | 图形渲染、科学计算、AI 训练和推理 |
4.2.2 矩阵乘法:为什么 GPU 和神经网络是天作之合
神经网络的计算核心是什么?矩阵乘法。
想象一个最简单的全连接层:1000 个输入神经元连接到 1000 个输出神经元。这一层的前向传播就是一个 1000 × 1000 的矩阵乘法——100 万次乘法和 100 万次加法同时进行。
在 CPU 上:一次做几个乘法,存起来,再做几个,再存起来——串行。
在 GPU 上:几千个计算核心同时各做一部分——并行。理论上 100 万次运算被 10000 个核心分摊,只需要 100 个并行步骤。
核心公式:$$并行加速比 ≈ GPU 核心数 / CPU 核心数$$
一块高端 GPU(如 H100)有约 17000 个 CUDA 核心。一块高端 CPU 有约 64 个核心。虽然是同一个数量级的粗略比较,但足以说明:对于矩阵乘法这种「大规模可并行的简单计算」,GPU 完胜。
4.2.3 不只是算的快:内存带宽
AI 计算的另一个瓶颈是内存带宽——数据从显存(GPU 内存)搬运到计算单元的速度。
大模型的参数和中间结果都很大(GPT-3 的 1750 亿参数用 16-bit 精度存储需要 350GB 空间)。计算单元再快,如果数据运不过来,还是得干等着。
| 硬件 | 内存带宽 | 说明 |
|---|---|---|
| 普通 CPU(DDR5) | ~50-100 GB/s | 受限于系统内存总线 |
| H100 GPU(HBM3) | ~3,350 GB/s | 宽总线 + 高带宽内存 |
| B200 GPU(HBM3e) | ~8,000 GB/s | 最新一代 |
GPU 的高带宽内存(HBM)是专门为这种大量数据搬运场景设计的——传统的系统内存(DDR)根本扛不住神经网络的数据吞吐量。
4.3 训练:烧钱的核心
4.3.1 训练 GPT-3 需要多少算力
训练 GPT-3(1750 亿参数)的总计算量大约是 3.14 × 10²³ FLOPs(约 3640 PFLOP/s-days)。
PFLOP/s-days:如果一个系统能持续提供 1 PFLOP/s(每秒 10¹⁵ 次浮点运算)的算力,那么 1 PFLOP/s-day 就是这个系统跑满 24 小时的总计算量。
用人话翻译:如果你有一块 A100 GPU(2020 年的旗舰),算力约 312 TFLOPS(FP16)。跑 GPT-3 的训练需要 约 3,200 块 A100 跑 1 天,或约 100 块 A100 跑 1 个月。
4.3.2 训练成本的时间线
| 模型 | 年份 | 参数量 | 估计训练算力 | 估计训练成本 |
|---|---|---|---|---|
| BERT-Large | 2018 | 3.4 亿 | ~50 PFLOP/s-days | ~数千美元 |
| GPT-2 | 2019 | 15 亿 | ~200 PFLOP/s-days | ~数万美元 |
| GPT-3 | 2020 | 1750 亿 | 3,640 PFLOP/s-days | ~数百万美元 |
| PaLM | 2022 | 5400 亿 | 29,200 PFLOP/s-days | ~数千万美元 |
| GPT-4 | 2023 | 未公布(传 ~1.8 万亿) | 估计 2-4 亿 PFLOP/s-days | ~数亿美元 |
| DeepSeek-V3 | 2024 | 6710 亿(MoE) | ~2,788,000 GPU 小时(H800) | ~557 万美元(极低,有争议) |
DeepSeek-V3 的成本争议:DeepSeek 声称训练成本仅 557 万美元,这个数字在业内引起了巨大震动——同期 GPT-4 级别的训练成本通常估计在数千万到上亿美元。这一差异来自多个因素:MoE 架构的效率提升、H800 的训练优化、以及中国相对较低的算力成本。但很多分析认为这个数字没有包含研发成本、失败的训练运行、人员成本等隐形成本。
4.3.3 训练成本的构成
训练一个大模型的成本不只是电费。完整构成包括:
pie title 训练一个大模型的成本构成(估算)
"GPU 集群采购/租赁" : 55
"电力与冷却" : 15
"数据采集与处理" : 10
"人员(研究员/工程师)" : 15
"其他(网络、存储等)" : 5- GPU 集群:最大的一块。购买和部署数千块高端 GPU 的成本高达数千万到数亿美元——租赁云 GPU 短期来看便宜些,但长期不如自建。
- 电力:一块 H100 GPU 的功耗约 700W。10000 块就是 7MW——一个中等规模的发电厂才能驱动。还有冷却系统——所有这些 GPU 都会产生巨大的热量。
- 数据:收集、清洗、过滤、去重数十亿级别的网页文本和书籍,需要大量的存储和工程工作。
- 人员:顶尖的 AI 研究员年薪动辄百万美元,一个团队几十人到几百人。
4.4 推理:每次聊天都在消耗什么
4.4.1 推理 vs 训练的计算差异
在第2章我们区分了训练和推理。从算力角度看,两者是完全不同的量级:
| 维度 | 训练 | 推理 |
|---|---|---|
| 目标 | 确定参数 | 使用参数生成输出 |
| 是否更新参数 | 是 | 否 |
| 数据流 | 前向 + 反向 | 仅前向 |
| 总计算量 | 天文数字 | 每次很小,但乘以用户数后也巨大 |
| 成本承担者 | AI 公司(一次性投入) | AI 公司(持续服务成本)+ 用户(API 调用费) |
4.4.2 推理服务为什么也费钱
虽然单次推理的算力开销远小于训练,但 ChatGPT 每天要服务数亿次对话。这需要部署大量的 GPU 集群来实现低延迟响应。
假设 GPT-4 级别的模型推理需要 8 块 H100 GPU 来服务(这是一个常见的估计):
- 服务 1000 个并发用户:需要约 8-16 块 H100
- 服务 100 万个并发用户:需要约 8000-16000 块 H100(这还不算负载平衡和冗余)
微软为 OpenAI 建设的数据中心据报道拥有数万块 GPU——而且一直在扩建。
4.4.3 KV Cache:推理优化的关键
在自回归生成(逐 token 生成)的过程中,每个新 token 都要做一次前向传播。但有一个重要的优化叫 KV Cache(键值缓存):
在第2章我们讲 Transformer 的自注意力——每个 token 都要和所有其他 token 做注意力计算。生成第 N 个 token 时,前面 N-1 个 token 的 Key 和 Value(自注意力计算中的两个矩阵)和上一轮是一模一样的——因为参数没变,输入也没变。所以可以缓存起来,不用重新算。
KV Cache 就是「别重新发明轮子」——已经算过的东西存起来,直接拿来用。
KV Cache 让自回归生成的每一步不需要重新处理整个序列,大幅降低了推理的延迟和计算量。但 KV Cache 也有代价——它占据大量的 GPU 显存。长上下文窗口之所以挑战巨大,KV Cache 的显存需求是指数级增长的。
4.5 GPU 简史:从游戏到 AI
4.5.1 NVIDIA 如何成为 AI 之王
2006 年,NVIDIA 发布了 CUDA(Compute Unified Device Architecture)——一个让开发者能用 GPU 做通用计算(不只是图形渲染)的编程平台。这个决定在当时看起来无足轻重——谁会想用显卡做数学计算?
但 CUDA 让一小部分科研人员发现:GPU 的并行架构特别适合神经网络的矩阵乘法。2012 年 AlexNet 用一块 GTX 580 训练出图像识别的惊人结果后,整个深度学习社区开始向 CUDA 生态迁移。
timeline
title NVIDIA 的 AI 之路
1999 : GeForce 256 : 第一款 GPU
2006 : CUDA 发布 : 通用 GPU 计算平台
2012 : AlexNet : 深度学习验证 GPU 优势
2017 : V100 : 第一款 AI 专用 Tensor Core
2020 : A100 : 训练 GPT-3 的主力
2022 : H100 : AI 训练 / 推理的新标杆
2024 : B200 : Blackwell 架构4.5.2 AI 时代的核心 GPU
| GPU | 年份 | FP16 算力 | 显存 | 功耗 | 典型用途 |
|---|---|---|---|---|---|
| V100 | 2017 | 125 TFLOPS | 32 GB HBM2 | 300W | BERT 时代的训练主力 |
| A100 | 2020 | 312 TFLOPS | 80 GB HBM2e | 400W | GPT-3 时代 |
| H100 | 2022 | 1979 TFLOPS | 80 GB HBM3 | 700W | GPT-4 时代 |
| H200 | 2024 | 1979 TFLOPS | 141 GB HBM3e | 700W | 推理优化(更大显存) |
| B200 | 2024 | 4500 TFLOPS | 192 GB HBM3e | 1000W | 下一代训练 / 推理 |
4.5.3 芯片禁运:AI 时代的地缘政治
2022 年 10 月,美国政府开始对出口到中国的 AI 芯片实施管制。H100 和 A100 被限制出口。NVIDIA 为此专门推出了「降速版」芯片(A800、H800)——通过降低芯片间的互联带宽来满足管制要求但又保留核心算力。
2023 年 10 月,管制进一步收紧——H800 也被禁了。NVIDIA 再次推出 H20 等更受限的版本。
这些管制对中国的 AI 发展产生了直接影响:
- 短期压力:无法获取最先进的 GPU,训练效率受限。
- 长期催化:加速了中国自研 AI 芯片(华为昇腾、寒武纪等)和软件优化的投入。DeepSeek 高效的训练方案就是在这种压力下催生的。
4.6 算力的规模效应:为什么大公司占优势
AI 训练遵循规模定律(见第2章),而这个定律有一个残酷的推论:
大模型只有大公司玩得起。
训练 GPT-4 据估计花费 2-5 亿美元。而「下一代的 GPT-5 / Claude 4」级别的模型,训练成本预期在 10 亿到 100 亿美元的区间。
这导致了三个趋势:
- 集中化:有能力训练前沿模型的实体越来越少——基本只剩 OpenAI(背靠微软)、Anthropic(背靠 Google 和 AWS)、Google、Meta、以及一两个中国公司。
- 开源的追赶:Meta 的 LLaMA 系列、Mistral、DeepSeek 等开源或半开源模型,正在缩小与闭源模型的差距,向市场提供了替代选择。
- 推理的优化:越来越多的技术(量化、蒸馏、MoE)在降低推理成本,让更小、更便宜的模型也能胜任许多实际任务。
本章小结
| 要点 | 一句话 |
|---|---|
| FLOPs | 衡量计算量的单位——一次浮点运算 |
| CPU vs GPU | CPU 像博士团队(串行强),GPU 像小学生军团(并行无敌) |
| 矩阵乘法 | 神经网络的核心——正好是 GPU 的强项 |
| 训练成本 | GPT-3 级别:数百万美元;GPT-4 级别:数亿美元 |
| 推理 | 单次便宜,大规模服务贵;KV Cache 是关键优化 |
| NVIDIA 的地位 | CUDA 生态 + 硬件迭代 = AI 基础设施的垄断者 |
| 芯片管制 | 地缘政治对 AI 芯片的出口限制深刻影响着全球 AI 格局 |
下一章预告
现在你知道了「模型怎么造出来」和「需要什么资源」。但使用过 ChatGPT 的人都会注意到一个现象:同一个问题,有时候答案像教科书,有时候像在胡说八道。
这是为什么?「温度」是什么参数?「幻觉」到底怎么回事?AI 是怎么「被调教」的?
| ← 上一章 | 回到目录 | 下一章 → |
|---|---|---|
| 第3章:Token | 第5章:温度、幻觉与对齐 |