术语表

本库核心术语按主题分组,正文首现处均附英文原词;术语也纳入站内搜索。

数据与张量

张量(Tensor)
向量和矩阵向任意维度的推广,深度学习框架中统一的数据容器;形状(shape)描述各维大小。
广播(Broadcasting)
两个形状不同的张量运算时,长度为 1 的维度自动扩展以匹配的规则。
数据类型(dtype)
张量的数值精度,如 float32(训练默认)、float16/bfloat16(混合精度)。
独热编码(One-hot)
类别标签的稀疏向量表示,正确类为 1 其余为 0。
批(Batch)
一次前向/更新使用的样本子集;批大小影响梯度噪声与显存。
Epoch
完整遍历一次训练集的轮次单位。
数据增强(Data Augmentation)
对训练样本施加保标签随机变换(翻转/裁剪等)以扩充数据多样性。

网络与机制

感知机(Perceptron)
最早的加权求和过阈值神经元模型,只能解线性可分问题。
多层感知机(MLP)
全连接层堆叠并夹非线性激活的最简深度网络。
激活函数(Activation Function)
对加权和逐元素施加的非线性变换(ReLU、Sigmoid、GELU 等)。
饱和(Saturation)
激活函数两端导数趋零的状态,是梯度消失的直接来源。
计算图(Computational Graph)
以运算为节点、张量为边的有向无环图,自动微分的载体。
自动微分(Automatic Differentiation)
沿计算图反向应用链式法则、自动求出所有参数梯度的机制。
反向传播(Backpropagation)
链式法则在层状网络上的系统实现,误差信号 δ 逐层回传。
梯度消失/爆炸(Vanishing/Exploding Gradient)
梯度沿层或时间连乘导致指数衰减或放大的数值病态。
感受野(Receptive Field)
某层输出单元能感知的原始输入区域大小,随深度增大。
特征图(Feature Map)
一个卷积核扫过输入得到的输出平面。
池化(Pooling)
局部窗口内取最大/平均的降采样操作,无学习参数。
残差连接(Residual Connection)
y = x + F(x) 的捷径结构,为梯度提供不衰减的直达通路。
门控(Gating)
LSTM/GRU 中以 sigmoid 输出控制信息保留/写入/读取比例的机制。
注意力机制(Attention)
以查询-键相似度经 softmax 加权取值的可微信息检索,公式 softmax(QKᵀ/√d)V。
词嵌入(Word Embedding)
把离散词映射为稠密向量的可学习查找表,语义相近者向量相近。

损失与优化

损失函数(Loss Function)
量化预测与真值差距的非负标量,训练的优化目标。
均方误差(MSE)
误差平方的均值,回归默认损失。
交叉熵(Cross-Entropy)
度量预测分布与真值分布差异的信息论量,分类默认损失。
Softmax
把 logits 归一化为概率分布的输出层激活;与交叉熵联合时梯度简化为 p − y。
梯度下降(Gradient Descent)
沿负梯度方向更新参数 θ ← θ − η∇L 的迭代优化法。
随机梯度下降(SGD)
用小批次噪声梯度估计全量梯度的梯度下降。
动量(Momentum)
梯度的指数移动平均,抑制振荡、加速一致方向。
Adam / AdamW
一阶矩 + 二阶矩自适应步长的优化器;AdamW 为解耦权重衰减版本。
学习率(Learning Rate)
每次更新的步长,影响力最大的单一超参数。
预热(Warmup)
训练初期从 0 线性升至目标学习率,防冷启动发散。
余弦退火(Cosine Annealing)
学习率沿余弦曲线平滑衰减到 0 的调度。
梯度裁剪(Gradient Clipping)
梯度范数超阈值时等比缩小(保方向缩模长),治爆炸。
截断 BPTT(Truncated BPTT)
沿时间只回传最近 k 步的序列训练技巧,控制显存与噪声。
困惑度(Perplexity)
语言模型指标,PPL = exp(平均交叉熵),可读作平均预测犹豫广度。

训练与泛化

过拟合(Overfitting)
模型记忆训练集噪声导致验证/测试表现下降的现象。
欠拟合(Underfitting)
模型容量或训练不足,训练集上都学不好的状态。
泛化(Generalization)
模型在未见数据上的表现,机器学习的根本目标。
正则化(Regularization)
抑制过拟合的一族手段(L2/权重衰减、Dropout、早停、增强)。
权重衰减(Weight Decay)
L2 正则在优化器中的等效形式,每步把参数乘 (1−ηλ)。
Dropout
训练时随机置零比例 p 的激活,等效隐式集成;inverted 版训练时除以 (1−p)。
早停(Early Stopping)
验证损失不再下降即停止训练并恢复最优检查点。
初始化(Initialization)
权重初值分布的设计;Xavier 适合 tanh、Kaiming 适合 ReLU。
批归一化(Batch Normalization)
按批标准化每层输入再用 γ、β 仿射还原,稳定训练、容忍大学习率。
LayerNorm
按样本特征维归一化的变体,Transformer 的选择。
训练/验证/测试集(Train/Val/Test)
学习、调参、终审三分数据集,信息只可单向流动。
数据泄漏(Data Leakage)
验证/测试信息违规混入训练或调参,导致指标虚高。
冒烟测试(Smoke Test)
用极小数据集训练到损失≈0,验证管道正确性的第一诊断。
检查点(Checkpoint)
模型与优化器状态的打包保存,早停恢复与断点续训的载体。
随机种子(Seed)
固定全部随机性来源的整数,可复现性的第一要素。

范式与前沿

迁移学习(Transfer Learning)
把源任务学到的表示迁移到目标任务的学习方式。
预训练(Pretraining)
用自监督任务在海量无标注数据上先学通用表示的阶段。
微调(Finetuning)
用小学习率在目标任务数据上继续训练预训练模型。
自监督学习(Self-Supervised Learning)
从无标注数据自动构造监督信号(下一词预测、遮词复原等)。
对抗样本(Adversarial Example)
微小人为扰动即导致高置信度错分的输入。
公平性(Fairness)
模型在不同群体间表现均衡性的操作性度量集合,定义本身存在争议。
可解释性(Interpretability)
理解模型决策依据的能力谱系,从热图到探针分析。