附录
术语表:名词速查
收录深度学习 / 大模型以及番外里的经典机器学习 / 无监督专用名词,每个一句话讲清并链到详解章节。 普通数学词(向量、矩阵、张量)、太泛的词(模型、训练、token)不在此列。 正文里蓝色虚线的词可点击查看释义。
网络基础
- 神经元 neuron — 最小积木:加权求和 + 偏置 + 激活函数。→ 第 2 章
- MLP 多层感知机 — 层层全连接的最朴素网络,适合固定长度输入。→ 第 3 章
- 前向传播 forward propagation — 数据从输入一层层向前流动,算出预测。→ 第 3 章
训练三件套
- 损失函数 loss — 把“错得多离谱”量化成一个数;越小越好。→ 第 4 章
- 交叉熵 cross-entropy — 分类常用损失,−log(正确类的预测概率)。→ 第 4 章
- softmax — 把一排分数变成一排加起来为 1 的概率。实现时要先减去这排里的最大值再取指数(见 log-sum-exp trick),否则会溢出。→ 第 4 章
- log-sum-exp trick — 算 softmax 前先给每个分数减去这组里的最大值。数学上完全等价(分子分母同乘 e−max),但能避免
exp溢出成 inf 或整体下溢成 0。→ 第 4 章 - KL 散度 KL divergence — 衡量两个概率分布差多远:完全相同为 0,越不像越大。PPO 用它限制新旧策略别差太多,RLHF 用它拴住模型别偏离原模型。→ 第 12 章
- 梯度下降 gradient descent — 沿梯度反方向一小步步降低损失。→ 第 5 章
- 梯度 gradient — 损失对每个参数偏导排成的一个向量,和参数同长,指向“上升最快”的方向。→ 第 5 章
- 鞍点 saddle point — 有的方向上坡、有的方向下坡的点,梯度也≈0 却不是谷底;高维里比局部最小更常见,和平坦区一起是训练卡住的主因。→ 第 5 章
- 学习率 learning rate — 每步挪多大;太大发散、太小太慢。→ 第 5 章
- batch / epoch / step — 一小撮样本 / 全数据过一遍 / 一次参数更新。→ 第 5 章
- 反向传播 backpropagation — 用链式法则把误差从输出反传回每个参数。→ 第 6 章
- 激活函数 activation — 给神经元加“非线性的弯”,没它深度就白搭。→ 第 7 章
- ReLU — 负数砍成 0、正数放行;最常用的默认激活。→ 第 7 章
- GELU — 平滑版 ReLU,Transformer / GPT 常用。→ 第 7 章
- SiLU / Swish — x · sigmoid(x) 的平滑自门控激活,输入越大越放行。→ 第 7 章 §3
- SwiGLU — 现代 LLM FFN 常用的门控结构,一路做内容、一路做开关,再逐元素相乘。→ 第 7 章 §3
- SiTU-GLU — Kimi K3 在 SwiGLU 两个分支上加入 tanh 平滑限幅的门控 FFN;正常区间近似 SwiGLU,极端区间有明确上界,用于控制低精度训练中的激活异常值。→ 第 7 章 §3
- 梯度消失 — 梯度反传时越乘越小、趋近 0,深层学不动(Sigmoid 易犯)。→ 第 7 章
- 优化器 optimizer — 决定“拿到梯度后参数怎么挪”的策略。→ 第 8 章
- Adam / AdamW — Momentum + 自适应步长 + 偏差校正;训大模型的默认选择。→ 第 8 章
训练技巧与评估
- 参数初始化 — 训练开始前给权重设一个合适的随机起点(如 He / Xavier)。→ 第 9 章
- 学习率调度 — 训练过程中动态调学习率(如 warmup + 余弦退火)。→ 第 9 章
- 范数 norm — 向量“有多长”的一种度量;梯度裁剪里用的是 L2 范数‖g‖ = √(各分量平方之和),就像平面上箭头从原点到尖端的直线距离。「按范数缩放」= 把每个分量都乘同一个小于 1 的数,只把总长度拉回阈值、方向不变(和“每个分量单独砍上限”不同)。→ 第 9 章 §4
- 梯度裁剪 — 给梯度设上限,防止爆炸导致训练崩;序列模型常用按全局 L2 范数整体等比缩短(见范数)。→ 第 9 章
- 过拟合 / 欠拟合 — 训练好测试差(背题) / 都差(没学会)。→ 第 10 章
- 正则化 regularization — 给学习加约束/干扰,逼模型别背训练集。→ 第 10 章
- weight decay(L2) — 惩罚过大权重,让模型更平滑克制。→ 第 10 章
- Dropout — 训练时随机关掉部分神经元,逼网络别依赖个别单元。→ 第 10 章
- 泛化 generalization — 在没见过的数据上也表现好,这才是真本事。→ 第 10 章
- 训练/验证/测试集 — 学 / 调 / 考三份互不重叠的数据。→ 第 11 章
- 精确率 / 召回 / F1 — 查得准 / 查得全 / 两者的调和平均。→ 第 11 章
- 数据泄漏 data leakage — 测试集信息偷偷进了训练(用全量数据算统计量、重复样本跨越 train/test),导致分数虚高、上线翻车。→ 第 11 章 §1
- 数据清洗 / 脏数据 — 喂模型前先处理缺失值、异常值、重复样本、标签错;去重要在切分前做,统计量只从训练集算。方法上:精确重复用哈希、近似重复用 MinHash/Jaccard 相似度、低质用规则+分类器/困惑度过滤。→ 第 11 章
网络结构
- CNN 卷积神经网络 — 用小卷积核在图上滑动,专治图像。→ 第 13 章
- 卷积核 / 感受野 / 权重共享 — 小滤波器只看局部、全图通用,省参数又平移不变。→ 第 13 章
- 池化 pooling — 把特征图缩小、增强鲁棒(最大/平均)。→ 第 13 章
- RNN 循环神经网络 — 用隐藏状态边读边记,处理序列;但串行、易失忆。→ 第 14 章
- BPTT 按时间反向传播 — RNN 展开后沿时间步反传;共享权重在各步的梯度相加。→ 第 14 章
- LSTM — 给 RNN 加“门”和记忆传送带,缓解长依赖失忆。→ 第 14 章
- 词嵌入 embedding — 把词表示成稠密向量(语义坐标),意思近则向量近。→ 第 15 章
- word2vec — 靠“看上下文”自监督学词向量(CBOW / skip-gram)。→ 第 15 章
注意力与 Transformer
- 注意力 attention — 让每个词直接看全序列,按相关性做加权平均。→ 第 17 章
- Q / K / V(查询/键/值) — 同一个词的三副面孔,来自三个可训练矩阵。→ 第 17 章
- causal mask 因果掩码 — 屏蔽未来位置,保证生成时只看前文。→ 第 17 章
- 多头注意力 — 同一输入先投影成 Q/K/V,再让多个头各自算一张 token×token 注意力表并拼接。→ 第 17 章
- 残差连接 residual — 输出 = x + 子层(x),给梯度修高速公路。→ 第 18 章
- Attention Residuals / AttnRes — Kimi K3 采用的一种跨层连接:沿网络深度给 embedding 和历史层表示动态加权;其 Block 版本用层块汇总降低显存和通信。→ 第 18 章
- LayerNorm — 对每个词向量减均值除标准差,稳住训练。→ 第 18 章
- Pre-LN / Post-LN — 归一化摆在子层前还是后。Post-LN 是原论文写法
LN(x+Sublayer(x));GPT-2 之后主流改成 Pre-LNx+Sublayer(LN(x)),让残差主干保持纯加法、深了不易训崩,代价是主干顶部要补一个 Final Norm。→ 第 18 章 - RMSNorm — LayerNorm 的简化版:不减均值、只除以均方根,通常还省掉偏置 β。少一半统计量、更快,现代大模型的常用替代。→ 第 18 章
- FFN 前馈网络 — 对每个 token 向量独立做“升维→激活→降维”,不跨词通信。→ 第 18 章
- 位置编码 — 把顺序和距离信息注入模型的一类方法,可以加到 embedding 上,也可以改 Q/K 或 attention 分数。→ 第 18 章
- RoPE 旋转位置编码 — 按位置旋转 Q/K 向量,让注意力点积天然带相对位置信息。→ 第 18 章
- ALiBi — 在 attention 分数里按距离加线性惩罚,让远处 token 默认更吃亏。→ 第 18 章
- Transformer — 注意力+残差+LayerNorm+FFN 拼成的可堆叠积木,大模型的地基。→ 第 18 章
- cross-attention 交叉注意力 — Q 来自解码器、K/V 来自编码器,解码时“查阅原文”。→ 第 18 章
- BERT / encoder-only — 只保留 Transformer 编码器左塔,双向看全句;经典训练是遮住词再猜回来的 MLM,擅长理解、分类、检索、抽取。→ 第 18 章
- decoder-only — 只保留生成侧 Transformer 塔、带 causal mask;GPT 系列属此类。→ 第 18 章
模型结构参数(读代码常见)
- model_dim 模型宽度 — 每个 token 用多宽的一条向量表示(一串有多少个数)。从 embedding 进、Transformer 层间传、LM Head 进,宽度都不变;决定大部分矩阵是 d×d。也叫 d_model、hidden size。→ 第 19 章
- vocab_size 词表大小 — 模型认识多少个不同的 token;嵌入表行数、LM Head 输出行数都由它决定。→ 第 19 章
- context_size 上下文长度 — 一次前向最多塞进多少个 token(上限);实际行数 n≤它。→ 第 19 章 §4.4
- head_num 注意力头数 — 把投影后的 Q/K/V 维度分成几段,并行算多套注意力。→ 第 17 章
- head_dim 每头宽度 — 每个头分到的维度,通常 = model_dim ÷ head_num。→ 第 17 章
- feed_forward_dim FFN 中间层宽度 — FFN 先把每个 token 向量升到这个宽度(常为 4×model_dim),再压回 model_dim。→ 第 18 章
- block_num 层数 — Transformer Block 堆叠多少层;每层各有一套 attention/FFN 参数。→ 第 18 章 · 参数量 → 第 20 章 §2
- LM Head 输出头 — 最后一层线性分类器:把 model_dim 维向量投影成词表上每个字的分数(logits)。→ 第 19 章
- logits 打分 — softmax 之前的原始分数,还不是概率;长度 = vocab_size。→ 第 19 章
- seq_len 序列长度 — 当前这句有多少个 token;与 context_size(上限)不同。→ 第 18 章
大模型
- 自回归 autoregressive — 把刚生成的词接回输入,循环往下写。→ 第 19 章
- temperature / top-k / top-p — 控制生成随机性与确定性的解码旋钮。→ 第 19 章 §7
- 困惑度 perplexity — 平均交叉熵取指数,衡量“平均在几个选项里纠结”。→ 第 19 章
- BPE 子词分词 — 把高频组合合并成一个 token,序列更短更高效。→ 第 20 章
- 开放权重 open weights — 发布训练完成后的参数文件,可以本地推理或继续微调;但不自动代表训练代码、完整配方和数据也公开,更不等于训练过程可复现。→ 第 20 章
- Scaling Law 规模定律 — 参数/数据/算力一起放大,性能可预测提升。→ 第 20 章
- 训练数据 / 有效数据 / 数据清洗 — 原始网页、代码、数学、授权内容等要经过正文抽取、去重、过滤、分类、配比、验证和分词打包,才会变成正确、独特、信息密度高且能补能力缺口的有效训练信号。数据工程 → 第 20 章 · 数据、算力与算法 → 第 20 章
- 参数量 — 可学习权重元素总数;GPT 系约 12Ld²+Vd。→ 第 20 章 §2
- 涌现能力 emergent abilities — 规模越过门槛后突然出现的新能力。→ 第 20 章
- 自监督 self-supervised — 答案从数据本身自动抠出(如遮词预测),不用人工标注。→ 第 20 章
- 预训练 / 后训练 — 海量文本上练底座 / SFT+RLHF+蒸馏调成好用的助手。→ 第 20 章
- 大模型测评 / benchmark — 用固定题集、真实任务、人工规则和线上反馈做质量控制:预训练选 checkpoint、后训练看对齐效果、上线前做门禁、上线后抓回归。→ 第 20 章
- RLHF / SFT / DPO — 按人类偏好对齐 / 用指令范文微调 / 直接用偏好对做对齐(跳过单独奖励模型)。→ 第 20 章 · RL → 第 12 章
- 强化学习 RL — 靠奖励试错学策略;MDP / Q-learning / PPO。→ 第 12 章 · 代码 → 第 25 章
- 对齐税 alignment tax — RLHF 后更安全听话,但部分能力/创造性可能下降。→ 第 20 章
- 灾难性遗忘 — 微调新任务时旧本领丢失;可用 LoRA/混训缓解。→ 第 20 章
- LoRA / PEFT — 参数高效微调:冻住底座大矩阵 W,只在旁边训练一对低秩小矩阵 A/B(y=Wx+BAx);可训练参数与显存省几十上百倍,产出的 adapter 才几 MB、可热插拔。→ 第 20 章
- 推理模型 reasoning model — 回答前用额外 reasoning token / 候选 / 验证轮次做测试时计算;思考深度由 effort 条件训练、外部预算、模型停机策略和 runtime 截断共同决定。→ 第 20 章
- 多模态 multimodal — 图/音 patch→编码→投影,与文字拼序列进 Transformer。→ 第 20 章
- CLIP — Contrastive Language-Image Pre-training;用图片编码器和文本编码器把配对图文向量拉近、不配对推远,把图和文字放进同一个语义空间。→ 第 20 章
- 扩散模型 Diffusion Model — 文生图/视频主流:训练学“去噪”,生成时从纯噪声反复去噪显影出图;文字用交叉注意力掌舵。→ 第 20 章
- 合成数据 synthetic data — 用强模型生成或改写题目、答案、解析和工具轨迹,再靠 verifier、测试、规则或人工抽检筛选后混入训练。→ 第 20 章
- 知识蒸馏 distillation — 让学生模型模仿教师模型的输出分布;新做法会用多个领域老师在线批改学生轨迹。→ 第 20 章
- 模型降智 — 常不是权重突然坏了,而是调用链路被压缩:同名模型被路由到便宜后端,推理预算更低、上下文更短、工具更少,再叠加量化、小模型和更保守安全壳。→ 第 21 章
- 幻觉 hallucination — 一本正经地生成通顺却编造的内容;常来自概率续写、知识缺口和“不会也猜”的评测激励。→ 第 20 章 · 可靠回答 → 第 22 章
- 归因图 attribution graph — 机制可解释性工具:把一次回答中被激活的特征及其影响关系画成图,再用干预实验验证模型内部电路。→ 第 22 章
- GPU / CPU — 芯片面积预算花法相反:CPU 把大半面积给控制/缓存,少数强核追低延迟(擅长复杂串行逻辑);GPU 几乎全铺 ALU,上万弱核追高吞吐(擅长海量独立乘加)。神经网络恰好是后者,故 GPU 快几十上百倍。更专一的 TPU / NPU 则干脆把电路直接做成矩阵乘法机。→ 第 29 章 · 大模型工程 → 第 21 章
- 显存 VRAM — GPU 自带的高速内存,要同时装下参数 + 梯度 + 优化器状态 + 激活值;常是“放不下”这堵墙先于“算得慢”撞上,逼出量化与多卡切分。→ 第 21 章 §3
- SIMT 单指令多线程 — GPU 省面积的关键:一组核心共享一套控制、齐步走同一条指令,只是各处理不同数据。省下控制电路能多塞 ALU,代价是最怕分支(遇 if-else 只能先全走 A 再全走 B)。矩阵乘法无分支,完美适配。→ 第 29 章 §12.1
- KV cache — 缓存已生成词的 Key/Value,避免重复计算,加速生成。→ 第 21 章
- 分布式并行训练 — 把训练切到多卡:数据并行 / 流水线并行 / 张量并行三种拆法。→ 第 21 章
- MoE 混合专家 — N 个并列 FFN 专家 + 路由器 top-k 门控;与专家端到端同训;总参多、算得少。→ 第 21 章
- 稠密 / 稀疏模型 — 按“每个 token 是否过全部参数”分:稠密模型全体参数都参与;稀疏模型(MoE)只激活 k 个专家,总参数 ≫ 激活参数。→ 第 21 章
- 稀疏注意力 — 只算部分 token 对,把 O(n²) 降下来。→ 第 21 章
- KDA / Kimi Delta Attention — 用通道级遗忘与 Delta 纠错,把逐 token 历史持续写进固定大小状态;Kimi K3 以 3 层 KDA + 1 层全局 MLA 混合使用。→ 第 21 章 §9
- 闪电索引器 lightning indexer — 稀疏注意力里的轻量打分器:先估当前 query 与历史 token 的相关性,取 top-k,再让真正 attention 精算。→ 第 21 章 §9
- MTP / 推测解码 — 训练时让同一隐藏状态预测多个未来 token,增加前瞻训练信号;推理时草稿器先提案,主模型批量验证并接受连续通过的 token,但接受率低时不一定加速。→ 第 21 章
- 生成-验证-修复-选择 — 复杂任务的推理系统范式:多候选搜索、验证器挑错、修复器改稿、排序器选最终答案。→ 第 22 章
- 提示工程 / 思维链 — 把话说清楚 / 让它“一步步想”提升推理。→ 第 22 章
- RAG 检索增强 — 先检索资料再让模型基于资料回答,治幻觉、补新知。→ 第 22 章
- function calling / Agent — 让模型调用工具、多步做事,从“会聊”变“能办”。→ 第 22 章
- 上下文工程 — 每步为 Agent 选择最小高信号上下文;靠动态压缩、外部 memory、经验手册和子 Agent 隔离噪声。→ 第 22 章
- Harness 工程 — 模型外面的工程外壳:执行循环、工具注册表、上下文管理器、状态存储、生命周期 hooks 和验证接口共同把模型接成可靠系统。→ 第 22 章
无监督与经典机器学习
- 聚类 clustering — 无标签时把相似样本自动分成几群。→ 第 27 章
- K-means — 最经典的聚类:交替做“归队”和“挪中心”直到稳定。→ 第 27 章
- PCA 主成分分析 — 找方差最大的方向,把高维数据压到更少维还尽量保信息。→ 第 27 章
- 决策树 — 从数据里自动长出一串 if-else;预测时从根走到叶子。→ 第 28 章
- 基尼不纯度 Gini — 衡量节点“有多杂”;越纯越接近 0,用来给候选切分打分。→ 第 28 章
- 随机森林 / Bagging — 多样本+多特征随机种许多树再投票,主要降方差。→ 第 28 章
- GBDT / Boosting — 串行种树,每棵专门拟合前面的残差,主要降偏差。→ 第 28 章