第7章:AI 术语速查手册

这章是工具书,不是教材。 不需要从头读到尾——当你碰到一个不认识的术语时,翻到这里找。每个术语用一句话讲清核心含义,再展开必要的细节。术语按主题分组,而不是按字母序——因为这样更容易在上下文中找到你想要的。


架构与模型类

LLM(大语言模型)

一句话:在海量文本上训练的、参数巨大的语言模型——ChatGPT、Claude、文心一言都属于此类。

「大」的核心是参数多(通常百亿起步)和训练数据多。LLM 这个缩写只指语言一类的模型——处理文本。处理图片的叫视觉模型,处理音频的叫语音模型。

📖 详见 第2章:大模型是什么

Transformer

一句话:2017 年提出的神经网络架构,用自注意力机制替代了之前 RNN 的串行处理——今天所有大模型的底层架构。

「Attention Is All You Need」这篇论文的影响怎么强调都不为过。在 Transformer 出现之前,处理文本的主流方法是 RNN/LSTM——逐词串行处理,速度慢、长距离遗忘、不能并行。Transformer 用注意力机制把整个序列同时处理,并行效率拉满,长距离依赖也不再是问题。

📖 详见 第2章 2.6 节

自注意力(Self-Attention)

一句话:让一个序列中的每个 token 都能「注意」序列中所有其他 token,并依语义相关性为每个 token 分配不同的注意力权重。

这是 Transformer 的心脏。它解决了「处理一个词时需要知道它和句子中所有其他词的关系」这一场景——而且不需要按顺序处理。

MoE(混合专家)

一句话:一种模型架构——模型包含多个「专家」子网络,但每次推理只激活其中一小部分,用更低的推理成本换取更大的总参数量。

DeepSeek-V3(6710 亿参数,每次激活约 370 亿)和 Mixtral 都用了 MoE。它的思想类似于:公司有 6000 名员工,但完成一个任务只需要调动 300 人——路由机制决定「这个任务给哪几个专家」。

📖 详见 第4章:算力

编码器 / 解码器(Encoder / Decoder)

一句话:Transformer 的两个组成部分——编码器「读」输入并理解它,解码器根据编码器的理解「写」输出。


训练与学习类

预训练(Pre-training)

一句话:在超大规模通用数据上训练基础模型的过程——产出的是「基础模型」。

GPT-3 的预训练就是:在 3000 亿 token 的文本上做「下一个词预测」这个唯一任务。预训练是烧钱的部分——几百万到几亿美元。预训练结束后,你就得到了一个「知道很多但不太会聊天」的基础模型。

微调(Fine-tuning)

一句话:在一个已经训练好的模型基础上,用更小、更专业的数据集进行额外训练——让模型在特定任务上表现更好。

微调比从头训练便宜得多——通常只需要几小时到几天(而非几个月)。比如拿 GPT-3 基础模型微调成 Codex(专门写代码的版本)。

SFT(监督微调)

一句话:用高质量的人工标注示例对基础模型做微调——让模型学会「人类期望的对话方式」。

SFT 的输出是「会聊天」的模型——回答而不是续写、礼貌而不是粗鲁、承认不知道而不是瞎编。但 SFT 只是第一步——后面的 RLHF 让模型更好。

📖 详见 第5章 5.3.2 节

RLHF(基于人类反馈的强化学习)

一句话:用人类标注员的偏好数据训练一个奖励模型,再用强化学习微调大模型——ChatGPT 成功的核心功臣。

三步走:SFT → 训练奖励模型 → PPO 强化学习。RLHF 解决了「模型回答对人类来说好不好」这个很难用简单规则衡量的问题。

📖 详见 第5章 5.3.2 节

DPO(直接偏好优化)

一句话:RLHF 的简化版——不训练奖励模型,直接从人类偏好数据中优化模型。

比 RLHF 更简单、更稳定,2023 年下半年开始在开源社区流行。可以理解为「去掉了中间商(奖励模型)的 RLHF」。

强化学习(Reinforcement Learning)

一句话:一种机器学习范式——AI 通过「试错 + 奖励信号」来学习,而不是通过标注数据。

在 LLM 语境下,强化学习主要用在对齐阶段(RLHF)。但在更广义的 AI 研究中,强化学习是 AlphaGo、自动驾驶、机器人控制等领域的核心技术。

蒸馏(Distillation / Knowledge Distillation)

一句话:用一个大的「教师模型」的输出作为训练信号,训练一个更小的「学生模型」——让小模型继承大模型的部分能力。

GPT-4 的输出被用来训练 GPT-4o-mini 的部分能力,就是蒸馏的典型应用。这也是本教程所在文件夹叫「蒸馏术」的原因——把大模型的能力「蒸馏」到更高效、更便宜的小模型上。

迁移学习(Transfer Learning)

一句话:将一个任务上学到的知识应用到另一个相关任务上。

在大模型时代,预训练 → 微调本身就是一种迁移学习:把在「下一个词预测」这个任务上学到的语言能力,迁移到「回答问题」「翻译」「写代码」等具体任务上。


推理与生成类

推理(Inference)

一句话:模型用训练好的参数对新输入产生输出的过程——你每次和 ChatGPT 对话都在做推理。

推理不改变模型的参数。和训练相比,单次推理的算力消耗小得多——但乘以数亿用户后,推理仍然需要巨大的 GPU 集群。

📖 详见 第2章 2.7 节

自回归生成(Autoregressive Generation)

一句话:逐 token 生成的方式——每一步的输出追加到序列后面,成为下一步的输入。

GPT 系列的所有模型都是自回归的——一个词接一个词地写。这也是为什么生成不能并行——你必须等上一个 token 生成完才知道下一个 token 要以什么为前文。

贪心解码(Greedy Decoding)

一句话:每一步都选概率最高的 token——最确定、最保守、但也最可能陷入重复循环。

很少在正式产品中单独使用——太无聊了。通常结合温度或其他采样策略。

温度(Temperature)

一句话:控制模型输出随机性的参数——低温 = 保守准确,高温 = 有创意但可能胡说。

📖 详见 第5章 5.1 节

Top-p / Top-k

一句话:采样策略——Top-k 限定只看概率最高的 k 个 token,Top-p 限定只看概率累加到 p 的那一批——都是防止模型选到极度不合理的 token。

📖 详见 第5章 5.1.4 节

KV Cache(键值缓存)

一句话:自回归推理的优化手段——缓存已经算过的 Key 和 Value,避免重复计算,大幅降低推理延迟。

📖 详见 第4章 4.4.3 节


应用与工程类

Prompt / Prompt Engineering

一句话:Prompt 是你给模型的输入文本;Prompt Engineering 是系统性地设计和优化 prompt 以得到更好输出的实践。

不是魔法咒语——有逻辑、有结构、有方法论。

📖 详见 第6章:Prompt

RAG(检索增强生成)

一句话:让模型在回答前先去外部知识库检索相关信息,再基于检索结果生成回答——是目前对抗幻觉最有效的方法。

典型流程:

flowchart LR
    Q[用户提问] --> R[检索相关文档]
    R --> C[将文档内容
拼入 Prompt] C --> M[模型基于
文档回答]

RAG 的关键优势:

Agent(智能体)

一句话:能自主规划、调用工具、多步执行复杂任务的 AI 系统——不只是回答问题,而是「做事情」。

一个完整的 Agent 通常包含:

Claudian(Obsidian 中的 AI agent)就是一个典型的 Agent 实例——它不只是在聊天窗口里回答,而是能读你的笔记、写你的文件、搜索你的 vault。

Function Calling / Tool Use

一句话:模型 API 提供的能力——让模型输出结构化的函数调用(JSON 格式),而不是自由文本——是现代 Agent 的基础设施。

当模型「决定」调用某个函数时,它输出的是函数名和参数(而非自然语言回答),然后程序执行这个函数,把结果返回给模型。

System Prompt(系统指令)

一句话:在对话开始前设置的行为准则和角色设定——定义「你是谁,怎么回答」——用户不可见但全程生效。

📖 详见 第6章 6.1.2 节

Few-shot / Zero-shot

一句话:Zero-shot = 不给示例直接问;Few-shot = 给几个示例再问——Few-shot 利用模型的模式匹配能力,通常效果更好。

📖 详见 第6章 6.2 节

思维链(Chain-of-Thought, CoT)

一句话:在 prompt 中引导模型「先推理再给答案」——大幅提升复杂推理任务的准确率。

📖 详见 第6章 6.2.3 节


Token 与上下文类

Token

一句话:大模型处理文本的最小单位——不是字也不是词,而是统计意义上最高频的字符组合。

📖 详见 第3章:Token

Embedding(嵌入)

一句话:把 token 映射成高维向量——语义相近的 token 在向量空间中距离也近。

Embedding 是模型「理解」语言的第一步。现代 LLM 的 embedding 是上下文感知的——同一个词在不同的句子中有不同的向量表示。

📖 详见 第3章 3.3 节

上下文窗口(Context Window)

一句话:模型在一次推理中能「看到」的 token 数上限——决定模型能处理多长的文本。

超长对话时,旧内容被截断就是因为这个窗口满了。

📖 详见 第3章 3.4 节

上下文长度(Context Length)

一句话:Context Window 的同义词——指模型输入能容纳的最大 token 数。


评价与问题类

幻觉(Hallucination)

一句话:模型输出的内容「听着合理但是假的」——是大语言模型目前最核心的未解决问题之一。

📖 详见 第5章 5.2 节

对齐(Alignment)

一句话:让模型的行为符合人类价值观和意图——技术上主要靠 RLHF / DPO 等方法实现。

📖 详见 第5章 5.3 节

过拟合(Overfitting)

一句话:模型在训练数据上表现极好,但在新数据上表现很差——相当于「死记硬背」而不是「理解规律」。

基准测试(Benchmark)

一句话:用标准化的测试集评估模型的性能——MMLU、HumanEval、GSM8K 等。

基准 测什么
MMLU 多学科知识(57 个学科)
HumanEval 代码生成能力
GSM8K 数学推理能力
HellaSwag 常识推理
MT-Bench 多轮对话质量

困惑度(Perplexity)

一句话:衡量语言模型质量的指标——困惑度越低,模型对文本的预测越准确。


数据类型类

多模态(Multimodal)

一句话:模型能处理多种类型的数据——不仅文本,还包括图片、音频、视频。

未来方向是「全模态」——一个模型同时理解和生成文本、图片、音频、视频、代码。

训练数据 / 测试数据

一句话:训练数据用来让模型「学习」(调整参数),测试数据用来验证模型「学了之后有多好」——两者不能重叠。

合成数据(Synthetic Data)

一句话:由另一个 AI 模型生成的数据,而非来自真实世界——用于训练或微调模型。

当真实数据不够或标注成本太高时,用合成数据补充。但合成数据有风险——可能导致模型「近亲繁殖」式的质量退化。


生态与商业类

开源 vs 闭源模型

一句话:开源模型公开参数权重(可以下载到本地运行),闭源模型只提供 API(参数保密)。

阵营 代表 优势 劣势
闭源 GPT-4, Claude, Gemini 性能最强;免运维 贵;数据隐私风险;不能定制
开源 LLaMA 3, DeepSeek, Qwen, Mistral 便宜;可本地部署;可定制 通常性能略低(差距在缩小)

API(应用接口)

一句话:模型提供方给出的程序化调用接口——你发 prompt 过去,它把生成的文本返回来——按 token 计费。

所有主流模型都提供 API:OpenAI API、Anthropic API、DeepSeek API、Google AI Studio 等。

GPU / TPU / NPU

一句话:AI 加速硬件——GPU(NVIDIA 主导)是通用 AI 加速器,TPU(Google 自研)专为 TensorFlow 优化,NPU(神经网络处理器)多用于端侧设备。

📖 详见 第4章 4.5 节

量化(Quantization)

一句话:用更低的数值精度(如 8-bit 或 4-bit 而非 16-bit)存储参数——大幅降低模型的存储和计算需求,代价是轻微的性能损失。

GGUF、GPTQ、AWQ 是常见的量化格式。量化使得在普通电脑甚至手机上运行 LLM 成为可能。


前沿与未来类

AGI(通用人工智能)

一句话:能在任何智力任务上和人类相当或超过人类水准的 AI——目前不存在,何时出现业内分歧极大。

📖 详见 第1章 1.7 节

ASI(超级智能)

一句话:远超人类最聪明的大脑的 AI——比 AGI 更高的一个层级——纯理论概念,目前没有实现路径。

推理模型(Reasoning Model)

一句话:在训练阶段就被强化了推理能力的模型——回答前会先进行内部推理(不可见的推理 token),然后再给出最终回答。

代表:OpenAI o1 系列、DeepSeek-R1。这些模型在数学、编程、科学推理等需要多步推理的任务上远超传统 LLM。它们本质上是在训练阶段就内化了思维链。

世界模型(World Model)

一句话:AI 对物理世界因果规律的内部表征——不是预测文本,而是预测「世界接下来会怎样」。

这是杨立昆(Meta 首席 AI 科学家)大力倡导的方向——他认为 LLM 的路不可能通向 AGI,需要让 AI 从感官数据中学习世界模型。目前世界模型还处于早期研究阶段。


附录:常见缩写速查

缩写 全称 中文
AI Artificial Intelligence 人工智能
ML Machine Learning 机器学习
DL Deep Learning 深度学习
NLP Natural Language Processing 自然语言处理
LLM Large Language Model 大语言模型
AGI Artificial General Intelligence 通用人工智能
RAG Retrieval-Augmented Generation 检索增强生成
RLHF Reinforcement Learning from Human Feedback 基于人类反馈的强化学习
SFT Supervised Fine-Tuning 监督微调
DPO Direct Preference Optimization 直接偏好优化
MoE Mixture of Experts 混合专家
CoT Chain of Thought 思维链
GPU Graphics Processing Unit 图形处理器
TPU Tensor Processing Unit 张量处理器(Google)
FLOPs Floating Point Operations 浮点运算次数
API Application Programming Interface 应用程序接口
JSON JavaScript Object Notation JSON 数据格式
PPO Proximal Policy Optimization 近似策略优化(强化学习算法)
KL Kullback-Leibler Divergence KL 散度(概率分布差异度量)
BPE Byte Pair Encoding 字节对编码(分词算法)

← 上一章 回到目录
第6章:Prompt 回到目录