第7章:AI 术语速查手册
这章是工具书,不是教材。 不需要从头读到尾——当你碰到一个不认识的术语时,翻到这里找。每个术语用一句话讲清核心含义,再展开必要的细节。术语按主题分组,而不是按字母序——因为这样更容易在上下文中找到你想要的。
架构与模型类
LLM(大语言模型)
一句话:在海量文本上训练的、参数巨大的语言模型——ChatGPT、Claude、文心一言都属于此类。
「大」的核心是参数多(通常百亿起步)和训练数据多。LLM 这个缩写只指语言一类的模型——处理文本。处理图片的叫视觉模型,处理音频的叫语音模型。
📖 详见 第2章:大模型是什么
Transformer
一句话:2017 年提出的神经网络架构,用自注意力机制替代了之前 RNN 的串行处理——今天所有大模型的底层架构。
「Attention Is All You Need」这篇论文的影响怎么强调都不为过。在 Transformer 出现之前,处理文本的主流方法是 RNN/LSTM——逐词串行处理,速度慢、长距离遗忘、不能并行。Transformer 用注意力机制把整个序列同时处理,并行效率拉满,长距离依赖也不再是问题。
📖 详见 第2章 2.6 节
自注意力(Self-Attention)
一句话:让一个序列中的每个 token 都能「注意」序列中所有其他 token,并依语义相关性为每个 token 分配不同的注意力权重。
这是 Transformer 的心脏。它解决了「处理一个词时需要知道它和句子中所有其他词的关系」这一场景——而且不需要按顺序处理。
MoE(混合专家)
一句话:一种模型架构——模型包含多个「专家」子网络,但每次推理只激活其中一小部分,用更低的推理成本换取更大的总参数量。
DeepSeek-V3(6710 亿参数,每次激活约 370 亿)和 Mixtral 都用了 MoE。它的思想类似于:公司有 6000 名员工,但完成一个任务只需要调动 300 人——路由机制决定「这个任务给哪几个专家」。
📖 详见 第4章:算力
编码器 / 解码器(Encoder / Decoder)
一句话:Transformer 的两个组成部分——编码器「读」输入并理解它,解码器根据编码器的理解「写」输出。
- 只用编码器的模型:BERT 系列——擅长理解(分类、提取、搜索)
- 只用解码器的模型:GPT 系列——擅长生成(续写、对话)
- 两者都用的模型:原始 Transformer(翻译)和 T5 系列
训练与学习类
预训练(Pre-training)
一句话:在超大规模通用数据上训练基础模型的过程——产出的是「基础模型」。
GPT-3 的预训练就是:在 3000 亿 token 的文本上做「下一个词预测」这个唯一任务。预训练是烧钱的部分——几百万到几亿美元。预训练结束后,你就得到了一个「知道很多但不太会聊天」的基础模型。
微调(Fine-tuning)
一句话:在一个已经训练好的模型基础上,用更小、更专业的数据集进行额外训练——让模型在特定任务上表现更好。
微调比从头训练便宜得多——通常只需要几小时到几天(而非几个月)。比如拿 GPT-3 基础模型微调成 Codex(专门写代码的版本)。
SFT(监督微调)
一句话:用高质量的人工标注示例对基础模型做微调——让模型学会「人类期望的对话方式」。
SFT 的输出是「会聊天」的模型——回答而不是续写、礼貌而不是粗鲁、承认不知道而不是瞎编。但 SFT 只是第一步——后面的 RLHF 让模型更好。
📖 详见 第5章 5.3.2 节
RLHF(基于人类反馈的强化学习)
一句话:用人类标注员的偏好数据训练一个奖励模型,再用强化学习微调大模型——ChatGPT 成功的核心功臣。
三步走:SFT → 训练奖励模型 → PPO 强化学习。RLHF 解决了「模型回答对人类来说好不好」这个很难用简单规则衡量的问题。
📖 详见 第5章 5.3.2 节
DPO(直接偏好优化)
一句话:RLHF 的简化版——不训练奖励模型,直接从人类偏好数据中优化模型。
比 RLHF 更简单、更稳定,2023 年下半年开始在开源社区流行。可以理解为「去掉了中间商(奖励模型)的 RLHF」。
强化学习(Reinforcement Learning)
一句话:一种机器学习范式——AI 通过「试错 + 奖励信号」来学习,而不是通过标注数据。
在 LLM 语境下,强化学习主要用在对齐阶段(RLHF)。但在更广义的 AI 研究中,强化学习是 AlphaGo、自动驾驶、机器人控制等领域的核心技术。
蒸馏(Distillation / Knowledge Distillation)
一句话:用一个大的「教师模型」的输出作为训练信号,训练一个更小的「学生模型」——让小模型继承大模型的部分能力。
GPT-4 的输出被用来训练 GPT-4o-mini 的部分能力,就是蒸馏的典型应用。这也是本教程所在文件夹叫「蒸馏术」的原因——把大模型的能力「蒸馏」到更高效、更便宜的小模型上。
迁移学习(Transfer Learning)
一句话:将一个任务上学到的知识应用到另一个相关任务上。
在大模型时代,预训练 → 微调本身就是一种迁移学习:把在「下一个词预测」这个任务上学到的语言能力,迁移到「回答问题」「翻译」「写代码」等具体任务上。
推理与生成类
推理(Inference)
一句话:模型用训练好的参数对新输入产生输出的过程——你每次和 ChatGPT 对话都在做推理。
推理不改变模型的参数。和训练相比,单次推理的算力消耗小得多——但乘以数亿用户后,推理仍然需要巨大的 GPU 集群。
📖 详见 第2章 2.7 节
自回归生成(Autoregressive Generation)
一句话:逐 token 生成的方式——每一步的输出追加到序列后面,成为下一步的输入。
GPT 系列的所有模型都是自回归的——一个词接一个词地写。这也是为什么生成不能并行——你必须等上一个 token 生成完才知道下一个 token 要以什么为前文。
贪心解码(Greedy Decoding)
一句话:每一步都选概率最高的 token——最确定、最保守、但也最可能陷入重复循环。
很少在正式产品中单独使用——太无聊了。通常结合温度或其他采样策略。
温度(Temperature)
一句话:控制模型输出随机性的参数——低温 = 保守准确,高温 = 有创意但可能胡说。
📖 详见 第5章 5.1 节
Top-p / Top-k
一句话:采样策略——Top-k 限定只看概率最高的 k 个 token,Top-p 限定只看概率累加到 p 的那一批——都是防止模型选到极度不合理的 token。
📖 详见 第5章 5.1.4 节
KV Cache(键值缓存)
一句话:自回归推理的优化手段——缓存已经算过的 Key 和 Value,避免重复计算,大幅降低推理延迟。
📖 详见 第4章 4.4.3 节
应用与工程类
Prompt / Prompt Engineering
一句话:Prompt 是你给模型的输入文本;Prompt Engineering 是系统性地设计和优化 prompt 以得到更好输出的实践。
不是魔法咒语——有逻辑、有结构、有方法论。
📖 详见 第6章:Prompt
RAG(检索增强生成)
一句话:让模型在回答前先去外部知识库检索相关信息,再基于检索结果生成回答——是目前对抗幻觉最有效的方法。
典型流程:
flowchart LR
Q[用户提问] --> R[检索相关文档]
R --> C[将文档内容
拼入 Prompt]
C --> M[模型基于
文档回答]RAG 的关键优势:
- 知识可更新:不需要重新训练模型,只需要更新知识库。
- 可溯源:每一条回答都能追溯到具体的来源文档。
- 降低幻觉:模型被「框定」在检索到的真实文档内容中回答。
Agent(智能体)
一句话:能自主规划、调用工具、多步执行复杂任务的 AI 系统——不只是回答问题,而是「做事情」。
一个完整的 Agent 通常包含:
- 规划能力:把大任务拆成小步骤
- 工具调用:能搜索网页、运行代码、读写文件、调用 API
- 记忆系统:记住中间结果和上下文
- 反思能力:检查自己的输出并修正
Claudian(Obsidian 中的 AI agent)就是一个典型的 Agent 实例——它不只是在聊天窗口里回答,而是能读你的笔记、写你的文件、搜索你的 vault。
Function Calling / Tool Use
一句话:模型 API 提供的能力——让模型输出结构化的函数调用(JSON 格式),而不是自由文本——是现代 Agent 的基础设施。
当模型「决定」调用某个函数时,它输出的是函数名和参数(而非自然语言回答),然后程序执行这个函数,把结果返回给模型。
System Prompt(系统指令)
一句话:在对话开始前设置的行为准则和角色设定——定义「你是谁,怎么回答」——用户不可见但全程生效。
📖 详见 第6章 6.1.2 节
Few-shot / Zero-shot
一句话:Zero-shot = 不给示例直接问;Few-shot = 给几个示例再问——Few-shot 利用模型的模式匹配能力,通常效果更好。
📖 详见 第6章 6.2 节
思维链(Chain-of-Thought, CoT)
一句话:在 prompt 中引导模型「先推理再给答案」——大幅提升复杂推理任务的准确率。
📖 详见 第6章 6.2.3 节
Token 与上下文类
Token
一句话:大模型处理文本的最小单位——不是字也不是词,而是统计意义上最高频的字符组合。
📖 详见 第3章:Token
Embedding(嵌入)
一句话:把 token 映射成高维向量——语义相近的 token 在向量空间中距离也近。
Embedding 是模型「理解」语言的第一步。现代 LLM 的 embedding 是上下文感知的——同一个词在不同的句子中有不同的向量表示。
📖 详见 第3章 3.3 节
上下文窗口(Context Window)
一句话:模型在一次推理中能「看到」的 token 数上限——决定模型能处理多长的文本。
超长对话时,旧内容被截断就是因为这个窗口满了。
📖 详见 第3章 3.4 节
上下文长度(Context Length)
一句话:Context Window 的同义词——指模型输入能容纳的最大 token 数。
评价与问题类
幻觉(Hallucination)
一句话:模型输出的内容「听着合理但是假的」——是大语言模型目前最核心的未解决问题之一。
📖 详见 第5章 5.2 节
对齐(Alignment)
一句话:让模型的行为符合人类价值观和意图——技术上主要靠 RLHF / DPO 等方法实现。
📖 详见 第5章 5.3 节
过拟合(Overfitting)
一句话:模型在训练数据上表现极好,但在新数据上表现很差——相当于「死记硬背」而不是「理解规律」。
基准测试(Benchmark)
一句话:用标准化的测试集评估模型的性能——MMLU、HumanEval、GSM8K 等。
| 基准 | 测什么 |
|---|---|
| MMLU | 多学科知识(57 个学科) |
| HumanEval | 代码生成能力 |
| GSM8K | 数学推理能力 |
| HellaSwag | 常识推理 |
| MT-Bench | 多轮对话质量 |
困惑度(Perplexity)
一句话:衡量语言模型质量的指标——困惑度越低,模型对文本的预测越准确。
数据类型类
多模态(Multimodal)
一句话:模型能处理多种类型的数据——不仅文本,还包括图片、音频、视频。
- GPT-4V / GPT-4o:能看图片
- Gemini:能看图片、听音频、看视频
- Sora:能生成视频
- Whisper:语音转文字
未来方向是「全模态」——一个模型同时理解和生成文本、图片、音频、视频、代码。
训练数据 / 测试数据
一句话:训练数据用来让模型「学习」(调整参数),测试数据用来验证模型「学了之后有多好」——两者不能重叠。
合成数据(Synthetic Data)
一句话:由另一个 AI 模型生成的数据,而非来自真实世界——用于训练或微调模型。
当真实数据不够或标注成本太高时,用合成数据补充。但合成数据有风险——可能导致模型「近亲繁殖」式的质量退化。
生态与商业类
开源 vs 闭源模型
一句话:开源模型公开参数权重(可以下载到本地运行),闭源模型只提供 API(参数保密)。
| 阵营 | 代表 | 优势 | 劣势 |
|---|---|---|---|
| 闭源 | GPT-4, Claude, Gemini | 性能最强;免运维 | 贵;数据隐私风险;不能定制 |
| 开源 | LLaMA 3, DeepSeek, Qwen, Mistral | 便宜;可本地部署;可定制 | 通常性能略低(差距在缩小) |
API(应用接口)
一句话:模型提供方给出的程序化调用接口——你发 prompt 过去,它把生成的文本返回来——按 token 计费。
所有主流模型都提供 API:OpenAI API、Anthropic API、DeepSeek API、Google AI Studio 等。
GPU / TPU / NPU
一句话:AI 加速硬件——GPU(NVIDIA 主导)是通用 AI 加速器,TPU(Google 自研)专为 TensorFlow 优化,NPU(神经网络处理器)多用于端侧设备。
📖 详见 第4章 4.5 节
量化(Quantization)
一句话:用更低的数值精度(如 8-bit 或 4-bit 而非 16-bit)存储参数——大幅降低模型的存储和计算需求,代价是轻微的性能损失。
GGUF、GPTQ、AWQ 是常见的量化格式。量化使得在普通电脑甚至手机上运行 LLM 成为可能。
前沿与未来类
AGI(通用人工智能)
一句话:能在任何智力任务上和人类相当或超过人类水准的 AI——目前不存在,何时出现业内分歧极大。
📖 详见 第1章 1.7 节
ASI(超级智能)
一句话:远超人类最聪明的大脑的 AI——比 AGI 更高的一个层级——纯理论概念,目前没有实现路径。
推理模型(Reasoning Model)
一句话:在训练阶段就被强化了推理能力的模型——回答前会先进行内部推理(不可见的推理 token),然后再给出最终回答。
代表:OpenAI o1 系列、DeepSeek-R1。这些模型在数学、编程、科学推理等需要多步推理的任务上远超传统 LLM。它们本质上是在训练阶段就内化了思维链。
世界模型(World Model)
一句话:AI 对物理世界因果规律的内部表征——不是预测文本,而是预测「世界接下来会怎样」。
这是杨立昆(Meta 首席 AI 科学家)大力倡导的方向——他认为 LLM 的路不可能通向 AGI,需要让 AI 从感官数据中学习世界模型。目前世界模型还处于早期研究阶段。
附录:常见缩写速查
| 缩写 | 全称 | 中文 |
|---|---|---|
| AI | Artificial Intelligence | 人工智能 |
| ML | Machine Learning | 机器学习 |
| DL | Deep Learning | 深度学习 |
| NLP | Natural Language Processing | 自然语言处理 |
| LLM | Large Language Model | 大语言模型 |
| AGI | Artificial General Intelligence | 通用人工智能 |
| RAG | Retrieval-Augmented Generation | 检索增强生成 |
| RLHF | Reinforcement Learning from Human Feedback | 基于人类反馈的强化学习 |
| SFT | Supervised Fine-Tuning | 监督微调 |
| DPO | Direct Preference Optimization | 直接偏好优化 |
| MoE | Mixture of Experts | 混合专家 |
| CoT | Chain of Thought | 思维链 |
| GPU | Graphics Processing Unit | 图形处理器 |
| TPU | Tensor Processing Unit | 张量处理器(Google) |
| FLOPs | Floating Point Operations | 浮点运算次数 |
| API | Application Programming Interface | 应用程序接口 |
| JSON | JavaScript Object Notation | JSON 数据格式 |
| PPO | Proximal Policy Optimization | 近似策略优化(强化学习算法) |
| KL | Kullback-Leibler Divergence | KL 散度(概率分布差异度量) |
| BPE | Byte Pair Encoding | 字节对编码(分词算法) |
| ← 上一章 | 回到目录 |
|---|---|
| 第6章:Prompt | 回到目录 |