预训练与迁移学习:范式转变
迁移学习(Transfer Learning)把在大数据上学到的表示迁移到小数据任务;其现代主形态「预训练 + 微调(pretrain → finetune)」——先用自监督任务在海量无标注数据上学通用表示,再用少量标注数据适配下游——是 2018 年起深度学习的主导范式,也是本库通往大模型时代的最后一扇门。
一句话定义
迁移学习(Transfer Learning)把在大数据上学到的表示迁移到小数据任务;其现代主形态「预训练 + 微调(pretrain → finetune)」——先用自监督任务在海量无标注数据上学通用表示,再用少量标注数据适配下游——是 2018 年起深度学习的主导范式,也是本库通往大模型时代的最后一扇门。
直觉
从头训练像「婴儿直接上大学」:什么都要从零学;预训练+微调像「先读完通识教育再进专业系」——语言、逻辑等通用能力(通用表示)先打底,专业任务只需少量课程(标注数据)就能毕业。
为什么重要
它改变了深度学习的游戏规则:kp-021 里 CIFAR-10 还要自己训 50 个 epoch,换成 ImageNet 预训练模型微调几分钟就能 95%+;kp-030 列出的「数据越多越好」在小数据任务上被「先验更重要」改写。理解「预训练为什么有效」需要动用本库全部积累——通用近似(kp-008)保证表示存在、分层特征(kp-018)保证低层通用、自监督(kp-024)提供免费监督——这是七维矩阵中「前沿」档的核心知识点,也是各后续站点(Transformer/大模型)的共同起点。
前置知识
- kp-021(从头训练的基线体验)、kp-024(自监督的思想源头——下一词预测)。
核心概念
- 源任务/目标任务:预训练所用的通用任务(如 ImageNet 1000 类、下一词预测)与最终业务任务。
- 自监督学习(self-supervised):从无标注数据自动构造监督信号(预测下一词、遮词复原、判别两个增强视图是否同源)。
- 微调(finetune):用目标任务数据、小学习率继续训练整个或部分网络。
- 冻结(freeze)/ 线性探针(linear probe):只训练最后的分类头,用于评估表示质量或数据极少场景。
- 特征复用层级:低层特征(边缘/纹理)跨任务通用,高层特征趋向任务特异——微调策略的依据。
- NLP 的两大预训练路线:BERT 式遮词(双向填空)与 GPT 式下一词(自回归)——细节属大模型站点,此处只留名字。
原理与机制
为什么迁移有效:kp-018 的特征层级给出结构性解释——视觉网络的第 1 层边缘检测器、第 2 层纹理部件检测器几乎与具体任务无关(自然图像的统计规律共享),只有末端几层编码「这张图属于哪一类」的任务知识。因此预训练模型的「通用底座」可以直接搬走,只需重造「任务顶层」。实践配方按数据量分档:目标任务数据极少(<1 千)时冻结主干、只训新分类头(线性探针);中等(1 千~10 万)时全量微调、小学习率(如 1e−4,比从头训练小一个量级)+ 短 epoch + 强增强;数据充足时从头训练反而常胜过微调(kp-021 就是这条路)。NLP 侧的故事线从 kp-024 延续:word2vec 的静态嵌入是「预训练 1.0」(只有词向量可迁移);2018 年 ELMo/BERT/GPT 让「整个模型」成为预训练产物(「预训练 2.0」)——BERT 用遮词复原(完形填空)学双向表示,GPT 用下一词预测(kp-024 的自回归目标)学生成,两者都以 Transformer(kp-026 的路标)为骨架;规模放大后出现「少样本涌现」,大模型时代开启——架构细节、缩放定律与对齐技术完全属于 Transformer/大模型独立站点,本库到此立牌收手。范式转变的工程含义:「模型」从「每次任务从头训练的一组权重」变成「可继承的资产」;kp-030 的误区之七在此闭环——对付过拟合的最强手段不是正则项,而是更好的先验(预训练表示)。
公式或模型
迁移学习的两阶段目标函数(形式化):
阶段一(预训练): θ* = argmin_θ E_{(x, x̃) ~ D_unlabeled} [ L_selfsup( x̃ ; θ ) ]
阶段二(微调): φ* = argmin_φ E_{(x, y) ~ D_task} [ L_task( f_{θ*,φ}(x), y ) ]
线性探针: 固定 θ*,只学分类头 φ(等价于用预训练特征做逻辑回归)变量说明:θ 为底座参数(GPT 式自监督即 kp-024 的逐词交叉熵),φ 为任务头;L_task 常为 kp-009 的交叉熵。微调学习率比预训练小 1~2 个量级,因为 θ* 已在损失面的好盆地(kp-010 的地形语言)。
图示
从头训练: 随机初始化 ──大量标注数据──► 任务模型 (kp-021 路线)
迁移学习: 海量无标注 ─自监督─► 通用底座 θ*
│ 冻结或小步微调
少量标注 ────────────┴─► 任务头 φ → 目标任务模型
低层:边缘/纹理(跨任务通用,直接搬) 高层:任务语义(需重训)直观类比
「微调学习率要小」像老房改造:底座结构(预训练权重)已经验收合格,只做精装修(任务头),大拆大建(大学习率)反而把承重墙砸了(灾难性遗忘)。
实例或案例
kp-021 的升级对照实验(最强直观说服):同一 CIFAR-10 分类任务——kp-021 从头训练 50 epoch 约 93%;换 torchvision 的预训练 ResNet18(把首层 7×7 卷积与池化改配 32×32 输入,或直接上采样到 224)微调 5 epoch 即 95%+,CPU 也能接受;冻结版线性探针 1 epoch 即约 90%。三个数字讲完整个范式转变的故事。NLP 侧的体验版:kp-024 的字符 LM 在小语料上 PPL 平台明显;换「先在大语料预训练、再小语料微调」两段式,PPL 立即下降——本库代码就能复现预训练红利的微缩版。后续去向声明:BERT/GPT 的架构(多头自注意力、掩码策略)、缩放定律、指令微调与对齐,请转入 Transformer/大模型独立站点——本库的 kp-024/026/本节三块砖已铺到其门口。
常见误区
- 「预训练万能,小数据也要全量微调」:数据极少时全量微调反而灾难性遗忘,冻结+探针或只调最后两块更稳。
- 「迁移学习只是 CV 玩法」:NLP 的范式转变更彻底(整模型即预训练产物),CV 与 NLP 的「预训练 2.0」本质同源。
- 「预训练模型不需要数据增强/正则」:微调阶段过拟合风险依旧(数据少),kp-013 的工具箱照常上岗。
- 「越大越好可以无脑选最大模型」:推理成本、领域差距(医学影像 vs 自然图)都会让中型专用模型反超。
与其他知识点的关系
本节消费 kp-008(表示存在性)、kp-018(特征层级——迁移有效的结构解释)、kp-024(自监督的祖师爷)、kp-026(Transformer 入口);它改写 kp-030 误区之七的答案、为 kp-021 提供升级选项;本节结尾即各独立站点(Transformer/大模型、强化学习)的共同起点,也是本库「前沿」档的收官。
自测题
- 用特征层级解释为什么预训练 CNN 的底层可以直接复用?
答案要点:低层学的是边缘/纹理等自然图像统计共性,与具体类别无关;任务语义集中在高层,故只重训顶层。
- 目标任务只有 500 张标注图,应选全量微调还是冻结+线性探针?为什么?
答案要点:冻结+探针(或微调末端几层);数据过少时全量微调会灾难性遗忘并过拟合。
- GPT 的预训练目标与本库哪个知识点同构?BERT 呢(一句话)?
答案要点:GPT 即 kp-024 的「下一词预测」自回归目标放大;BERT 用遮词复原(完形填空式自监督)——两者细节均在 Transformer 站点展开。
延伸阅读
- Pan、Yang《A Survey on Transfer Learning» IEEE TKDE 2010(迁移学习分类学)。
- Devlin 等《BERT》NAACL 2019;Radford 等《Improving Language Understanding by Generative Pre-Training» 2018(两大预训练路线原始论文;深入请转 Transformer/大模型独立站点)。
学习状态
状态保存在浏览器本地,用于首页与路径页的进度统计。