术语表
本库核心术语按主题分组,正文首现处均附英文原词;术语也纳入站内搜索。
数据与张量
- 张量(Tensor)
- 向量和矩阵向任意维度的推广,深度学习框架中统一的数据容器;形状(shape)描述各维大小。
- 广播(Broadcasting)
- 两个形状不同的张量运算时,长度为 1 的维度自动扩展以匹配的规则。
- 数据类型(dtype)
- 张量的数值精度,如 float32(训练默认)、float16/bfloat16(混合精度)。
- 独热编码(One-hot)
- 类别标签的稀疏向量表示,正确类为 1 其余为 0。
- 批(Batch)
- 一次前向/更新使用的样本子集;批大小影响梯度噪声与显存。
- Epoch
- 完整遍历一次训练集的轮次单位。
- 数据增强(Data Augmentation)
- 对训练样本施加保标签随机变换(翻转/裁剪等)以扩充数据多样性。
网络与机制
- 感知机(Perceptron)
- 最早的加权求和过阈值神经元模型,只能解线性可分问题。
- 多层感知机(MLP)
- 全连接层堆叠并夹非线性激活的最简深度网络。
- 激活函数(Activation Function)
- 对加权和逐元素施加的非线性变换(ReLU、Sigmoid、GELU 等)。
- 饱和(Saturation)
- 激活函数两端导数趋零的状态,是梯度消失的直接来源。
- 计算图(Computational Graph)
- 以运算为节点、张量为边的有向无环图,自动微分的载体。
- 自动微分(Automatic Differentiation)
- 沿计算图反向应用链式法则、自动求出所有参数梯度的机制。
- 反向传播(Backpropagation)
- 链式法则在层状网络上的系统实现,误差信号 δ 逐层回传。
- 梯度消失/爆炸(Vanishing/Exploding Gradient)
- 梯度沿层或时间连乘导致指数衰减或放大的数值病态。
- 感受野(Receptive Field)
- 某层输出单元能感知的原始输入区域大小,随深度增大。
- 特征图(Feature Map)
- 一个卷积核扫过输入得到的输出平面。
- 池化(Pooling)
- 局部窗口内取最大/平均的降采样操作,无学习参数。
- 残差连接(Residual Connection)
- y = x + F(x) 的捷径结构,为梯度提供不衰减的直达通路。
- 门控(Gating)
- LSTM/GRU 中以 sigmoid 输出控制信息保留/写入/读取比例的机制。
- 注意力机制(Attention)
- 以查询-键相似度经 softmax 加权取值的可微信息检索,公式 softmax(QKᵀ/√d)V。
- 词嵌入(Word Embedding)
- 把离散词映射为稠密向量的可学习查找表,语义相近者向量相近。
损失与优化
- 损失函数(Loss Function)
- 量化预测与真值差距的非负标量,训练的优化目标。
- 均方误差(MSE)
- 误差平方的均值,回归默认损失。
- 交叉熵(Cross-Entropy)
- 度量预测分布与真值分布差异的信息论量,分类默认损失。
- Softmax
- 把 logits 归一化为概率分布的输出层激活;与交叉熵联合时梯度简化为 p − y。
- 梯度下降(Gradient Descent)
- 沿负梯度方向更新参数 θ ← θ − η∇L 的迭代优化法。
- 随机梯度下降(SGD)
- 用小批次噪声梯度估计全量梯度的梯度下降。
- 动量(Momentum)
- 梯度的指数移动平均,抑制振荡、加速一致方向。
- Adam / AdamW
- 一阶矩 + 二阶矩自适应步长的优化器;AdamW 为解耦权重衰减版本。
- 学习率(Learning Rate)
- 每次更新的步长,影响力最大的单一超参数。
- 预热(Warmup)
- 训练初期从 0 线性升至目标学习率,防冷启动发散。
- 余弦退火(Cosine Annealing)
- 学习率沿余弦曲线平滑衰减到 0 的调度。
- 梯度裁剪(Gradient Clipping)
- 梯度范数超阈值时等比缩小(保方向缩模长),治爆炸。
- 截断 BPTT(Truncated BPTT)
- 沿时间只回传最近 k 步的序列训练技巧,控制显存与噪声。
- 困惑度(Perplexity)
- 语言模型指标,PPL = exp(平均交叉熵),可读作平均预测犹豫广度。
训练与泛化
- 过拟合(Overfitting)
- 模型记忆训练集噪声导致验证/测试表现下降的现象。
- 欠拟合(Underfitting)
- 模型容量或训练不足,训练集上都学不好的状态。
- 泛化(Generalization)
- 模型在未见数据上的表现,机器学习的根本目标。
- 正则化(Regularization)
- 抑制过拟合的一族手段(L2/权重衰减、Dropout、早停、增强)。
- 权重衰减(Weight Decay)
- L2 正则在优化器中的等效形式,每步把参数乘 (1−ηλ)。
- Dropout
- 训练时随机置零比例 p 的激活,等效隐式集成;inverted 版训练时除以 (1−p)。
- 早停(Early Stopping)
- 验证损失不再下降即停止训练并恢复最优检查点。
- 初始化(Initialization)
- 权重初值分布的设计;Xavier 适合 tanh、Kaiming 适合 ReLU。
- 批归一化(Batch Normalization)
- 按批标准化每层输入再用 γ、β 仿射还原,稳定训练、容忍大学习率。
- LayerNorm
- 按样本特征维归一化的变体,Transformer 的选择。
- 训练/验证/测试集(Train/Val/Test)
- 学习、调参、终审三分数据集,信息只可单向流动。
- 数据泄漏(Data Leakage)
- 验证/测试信息违规混入训练或调参,导致指标虚高。
- 冒烟测试(Smoke Test)
- 用极小数据集训练到损失≈0,验证管道正确性的第一诊断。
- 检查点(Checkpoint)
- 模型与优化器状态的打包保存,早停恢复与断点续训的载体。
- 随机种子(Seed)
- 固定全部随机性来源的整数,可复现性的第一要素。
范式与前沿
- 迁移学习(Transfer Learning)
- 把源任务学到的表示迁移到目标任务的学习方式。
- 预训练(Pretraining)
- 用自监督任务在海量无标注数据上先学通用表示的阶段。
- 微调(Finetuning)
- 用小学习率在目标任务数据上继续训练预训练模型。
- 自监督学习(Self-Supervised Learning)
- 从无标注数据自动构造监督信号(下一词预测、遮词复原等)。
- 对抗样本(Adversarial Example)
- 微小人为扰动即导致高置信度错分的输入。
- 公平性(Fairness)
- 模型在不同群体间表现均衡性的操作性度量集合,定义本身存在争议。
- 可解释性(Interpretability)
- 理解模型决策依据的能力谱系,从热图到探针分析。