第4章:算力 —— 大模型的燃料

本章解决的核心问题:大模型需要惊人的计算资源。算力是什么?GPU 凭什么比 CPU 更适合 AI?训练一个 GPT-4 级别的模型到底要花多少钱?推理和训练的算力需求有什么不同?读完这一章,你能看懂 AI 行业「军备竞赛」背后的技术逻辑。


4.1 算力的基本单位:从 FLOPs 开始

4.1.1 什么是 FLOPs

在讨论 GPU 和训练成本之前,我们需要一个衡量「计算量」的单位。

区分这三个写法很重要,但它们极易混淆——包括在专业论文里也经常混用。本教程中我们一律用:

4.1.2 量级的直觉

单位 全称 数量级 类比
1 FLOP 一次浮点运算 1 一个人心算一次加法
1 GFLOP(千兆) 10⁹ FLOPs 10 亿 一部智能手机一秒钟的算力
1 TFLOP(兆) 10¹² FLOPs 1 万亿 一块高端 GPU 的算力
1 PFLOP(千兆) 10¹⁵ FLOPs 1000 万亿 一个小型数据中心的算力
1 EFLOP(百京) 10¹⁸ FLOPs 100 亿亿 GPT-4 级别模型的训练算力

用一个更直观的比喻:如果一次浮点运算相当于一颗大米粒,那么训练 GPT-3(3.14 × 10²³ FLOPs)的大米粒体积大约相当于整个太平洋


4.2 CPU vs GPU:卡车队与千帆竞渡

4.2.1 核心区别

flowchart TB
    subgraph cpu[CPU 中央处理器]
        C1[核心 1
超强] C2[核心 2
超强] C3[核心 3
超强] C4[核心 4
超强] end subgraph gpu[GPU 图形处理器] G1[核心 1] --- G2[核心 2] --- G3[核心 3] --- G4[...] G5[核心 N-3] --- G6[核心 N-2] --- G7[核心 N-1] --- G8[核心 N] end
维度 CPU GPU
核心数 几个到几十个 几千到上万个
单核心能力 极强(复杂逻辑、分支预测) 较弱(只能做简单运算)
擅长任务 串行任务(一个接着一个做) 并行任务(几千个同时做)
类比 博士团队(人少但精) 小学生军团(人多但每人只会基础运算)
典型用途 操作系统、数据库、游戏逻辑 图形渲染、科学计算、AI 训练和推理

4.2.2 矩阵乘法:为什么 GPU 和神经网络是天作之合

神经网络的计算核心是什么?矩阵乘法

想象一个最简单的全连接层:1000 个输入神经元连接到 1000 个输出神经元。这一层的前向传播就是一个 1000 × 1000 的矩阵乘法——100 万次乘法和 100 万次加法同时进行。

在 CPU 上:一次做几个乘法,存起来,再做几个,再存起来——串行
在 GPU 上:几千个计算核心同时各做一部分——并行。理论上 100 万次运算被 10000 个核心分摊,只需要 100 个并行步骤。

核心公式:$$并行加速比 ≈ GPU 核心数 / CPU 核心数$$

一块高端 GPU(如 H100)有约 17000 个 CUDA 核心。一块高端 CPU 有约 64 个核心。虽然是同一个数量级的粗略比较,但足以说明:对于矩阵乘法这种「大规模可并行的简单计算」,GPU 完胜。

4.2.3 不只是算的快:内存带宽

AI 计算的另一个瓶颈是内存带宽——数据从显存(GPU 内存)搬运到计算单元的速度。

大模型的参数和中间结果都很大(GPT-3 的 1750 亿参数用 16-bit 精度存储需要 350GB 空间)。计算单元再快,如果数据运不过来,还是得干等着。

硬件 内存带宽 说明
普通 CPU(DDR5) ~50-100 GB/s 受限于系统内存总线
H100 GPU(HBM3) ~3,350 GB/s 宽总线 + 高带宽内存
B200 GPU(HBM3e) ~8,000 GB/s 最新一代

GPU 的高带宽内存(HBM)是专门为这种大量数据搬运场景设计的——传统的系统内存(DDR)根本扛不住神经网络的数据吞吐量。


4.3 训练:烧钱的核心

4.3.1 训练 GPT-3 需要多少算力

训练 GPT-3(1750 亿参数)的总计算量大约是 3.14 × 10²³ FLOPs(约 3640 PFLOP/s-days)。

PFLOP/s-days:如果一个系统能持续提供 1 PFLOP/s(每秒 10¹⁵ 次浮点运算)的算力,那么 1 PFLOP/s-day 就是这个系统跑满 24 小时的总计算量。

用人话翻译:如果你有一块 A100 GPU(2020 年的旗舰),算力约 312 TFLOPS(FP16)。跑 GPT-3 的训练需要 约 3,200 块 A100 跑 1 天,或约 100 块 A100 跑 1 个月

4.3.2 训练成本的时间线

模型 年份 参数量 估计训练算力 估计训练成本
BERT-Large 2018 3.4 亿 ~50 PFLOP/s-days ~数千美元
GPT-2 2019 15 亿 ~200 PFLOP/s-days ~数万美元
GPT-3 2020 1750 亿 3,640 PFLOP/s-days ~数百万美元
PaLM 2022 5400 亿 29,200 PFLOP/s-days ~数千万美元
GPT-4 2023 未公布(传 ~1.8 万亿) 估计 2-4 亿 PFLOP/s-days ~数亿美元
DeepSeek-V3 2024 6710 亿(MoE) ~2,788,000 GPU 小时(H800) ~557 万美元(极低,有争议)

DeepSeek-V3 的成本争议:DeepSeek 声称训练成本仅 557 万美元,这个数字在业内引起了巨大震动——同期 GPT-4 级别的训练成本通常估计在数千万到上亿美元。这一差异来自多个因素:MoE 架构的效率提升、H800 的训练优化、以及中国相对较低的算力成本。但很多分析认为这个数字没有包含研发成本、失败的训练运行、人员成本等隐形成本。

4.3.3 训练成本的构成

训练一个大模型的成本不只是电费。完整构成包括:

pie title 训练一个大模型的成本构成(估算)
    "GPU 集群采购/租赁" : 55
    "电力与冷却" : 15
    "数据采集与处理" : 10
    "人员(研究员/工程师)" : 15
    "其他(网络、存储等)" : 5

4.4 推理:每次聊天都在消耗什么

4.4.1 推理 vs 训练的计算差异

在第2章我们区分了训练和推理。从算力角度看,两者是完全不同的量级:

维度 训练 推理
目标 确定参数 使用参数生成输出
是否更新参数
数据流 前向 + 反向 仅前向
总计算量 天文数字 每次很小,但乘以用户数后也巨大
成本承担者 AI 公司(一次性投入) AI 公司(持续服务成本)+ 用户(API 调用费)

4.4.2 推理服务为什么也费钱

虽然单次推理的算力开销远小于训练,但 ChatGPT 每天要服务数亿次对话。这需要部署大量的 GPU 集群来实现低延迟响应。

假设 GPT-4 级别的模型推理需要 8 块 H100 GPU 来服务(这是一个常见的估计):

微软为 OpenAI 建设的数据中心据报道拥有数万块 GPU——而且一直在扩建。

4.4.3 KV Cache:推理优化的关键

在自回归生成(逐 token 生成)的过程中,每个新 token 都要做一次前向传播。但有一个重要的优化叫 KV Cache(键值缓存)

在第2章我们讲 Transformer 的自注意力——每个 token 都要和所有其他 token 做注意力计算。生成第 N 个 token 时,前面 N-1 个 token 的 Key 和 Value(自注意力计算中的两个矩阵)和上一轮是一模一样的——因为参数没变,输入也没变。所以可以缓存起来,不用重新算。

KV Cache 就是「别重新发明轮子」——已经算过的东西存起来,直接拿来用。

KV Cache 让自回归生成的每一步不需要重新处理整个序列,大幅降低了推理的延迟和计算量。但 KV Cache 也有代价——它占据大量的 GPU 显存。长上下文窗口之所以挑战巨大,KV Cache 的显存需求是指数级增长的。


4.5 GPU 简史:从游戏到 AI

4.5.1 NVIDIA 如何成为 AI 之王

2006 年,NVIDIA 发布了 CUDA(Compute Unified Device Architecture)——一个让开发者能用 GPU 做通用计算(不只是图形渲染)的编程平台。这个决定在当时看起来无足轻重——谁会想用显卡做数学计算?

但 CUDA 让一小部分科研人员发现:GPU 的并行架构特别适合神经网络的矩阵乘法。2012 年 AlexNet 用一块 GTX 580 训练出图像识别的惊人结果后,整个深度学习社区开始向 CUDA 生态迁移。

timeline
    title NVIDIA 的 AI 之路
    1999 : GeForce 256 : 第一款 GPU
    2006 : CUDA 发布 : 通用 GPU 计算平台
    2012 : AlexNet : 深度学习验证 GPU 优势
    2017 : V100 : 第一款 AI 专用 Tensor Core
    2020 : A100 : 训练 GPT-3 的主力
    2022 : H100 : AI 训练 / 推理的新标杆
    2024 : B200 : Blackwell 架构

4.5.2 AI 时代的核心 GPU

GPU 年份 FP16 算力 显存 功耗 典型用途
V100 2017 125 TFLOPS 32 GB HBM2 300W BERT 时代的训练主力
A100 2020 312 TFLOPS 80 GB HBM2e 400W GPT-3 时代
H100 2022 1979 TFLOPS 80 GB HBM3 700W GPT-4 时代
H200 2024 1979 TFLOPS 141 GB HBM3e 700W 推理优化(更大显存)
B200 2024 4500 TFLOPS 192 GB HBM3e 1000W 下一代训练 / 推理

4.5.3 芯片禁运:AI 时代的地缘政治

2022 年 10 月,美国政府开始对出口到中国的 AI 芯片实施管制。H100 和 A100 被限制出口。NVIDIA 为此专门推出了「降速版」芯片(A800、H800)——通过降低芯片间的互联带宽来满足管制要求但又保留核心算力。

2023 年 10 月,管制进一步收紧——H800 也被禁了。NVIDIA 再次推出 H20 等更受限的版本。

这些管制对中国的 AI 发展产生了直接影响:


4.6 算力的规模效应:为什么大公司占优势

AI 训练遵循规模定律(见第2章),而这个定律有一个残酷的推论:

大模型只有大公司玩得起。

训练 GPT-4 据估计花费 2-5 亿美元。而「下一代的 GPT-5 / Claude 4」级别的模型,训练成本预期在 10 亿到 100 亿美元的区间。

这导致了三个趋势:

  1. 集中化:有能力训练前沿模型的实体越来越少——基本只剩 OpenAI(背靠微软)、Anthropic(背靠 Google 和 AWS)、Google、Meta、以及一两个中国公司。
  2. 开源的追赶:Meta 的 LLaMA 系列、Mistral、DeepSeek 等开源或半开源模型,正在缩小与闭源模型的差距,向市场提供了替代选择。
  3. 推理的优化:越来越多的技术(量化、蒸馏、MoE)在降低推理成本,让更小、更便宜的模型也能胜任许多实际任务。

本章小结

要点 一句话
FLOPs 衡量计算量的单位——一次浮点运算
CPU vs GPU CPU 像博士团队(串行强),GPU 像小学生军团(并行无敌)
矩阵乘法 神经网络的核心——正好是 GPU 的强项
训练成本 GPT-3 级别:数百万美元;GPT-4 级别:数亿美元
推理 单次便宜,大规模服务贵;KV Cache 是关键优化
NVIDIA 的地位 CUDA 生态 + 硬件迭代 = AI 基础设施的垄断者
芯片管制 地缘政治对 AI 芯片的出口限制深刻影响着全球 AI 格局

下一章预告

现在你知道了「模型怎么造出来」和「需要什么资源」。但使用过 ChatGPT 的人都会注意到一个现象:同一个问题,有时候答案像教科书,有时候像在胡说八道。

这是为什么?「温度」是什么参数?「幻觉」到底怎么回事?AI 是怎么「被调教」的?

第5章:温度、幻觉与对齐


← 上一章 回到目录 下一章 →
第3章:Token 第5章:温度、幻觉与对齐