深度学习全景与学习地图
深度学习(Deep Learning)是机器学习的一个分支,用多层可微函数堆叠成的神经网络,从数据中自动学习分层特征表示,而无需人工设计特征。
一句话定义
深度学习(Deep Learning)是机器学习的一个分支,用多层可微函数堆叠成的神经网络,从数据中自动学习分层特征表示,而无需人工设计特征。
直觉
传统机器学习像「请专家手工提取特征再喂给分类器」——你告诉它看哪里;深度学习像「给一台自动特征提取机」——原始数据进去,有用的表示一层层长出来,任务答案在最后一层出来。
为什么重要
深度学习是 2012 年以来计算机视觉、语音识别、自然语言处理突破性进展的公共引擎,也是 Transformer、大模型、强化学习等前沿方向的公共地基。不建立全景视角,后续学习容易陷入「只识招式不明心法」:会调包但说不清每一步为什么存在。本站全部内容都建立在这张地图上。
前置知识
- 无本库内知识点前置,本知识点是全站入口。
- 库外前置:高中以上数学直觉(函数、导数的几何意义)即可开始;线性代数与微积分细节可在后续 KP 中随用随补。
核心概念
- 人工智能(AI):让机器表现出智能行为的总称,范围最大。
- 机器学习(Machine Learning):AI 的子集,不直接写规则,而是从数据中拟合函数 f: x → y。
- 深度学习:机器学习的子集,模型是多层神经网络,特点是「端到端 + 表示学习」。
- 表示学习(Representation Learning):让模型自己学出对任务有用的中间特征,替代人工特征工程。
- 模型/参数/训练:模型是带可调参数 θ 的函数族;训练是按某种目标(损失)用数据调整 θ 的过程。
- 泛化(Generalization):模型在没见过的数据上的表现,是机器学习的根本目标而非记住训练集。
原理与机制
三者关系是层层包含:AI ⊃ 机器学习 ⊃ 深度学习。机器学习按监督信号可分为监督学习(有标签)、无监督/自监督学习(无标签,自造监督信号)、强化学习(环境反馈)。深度学习的核心机制链是:数据以张量形式输入 → 网络前向计算得到预测 → 损失函数度量预测与真值差距 → 反向传播算出每个参数的梯度 → 优化器沿梯度更新参数 → 循环往复直到收敛。这条链上每个环节,正对应本库的模块划分:张量与自动微分(模块 01)、网络结构与反向传播(模块 02)、损失与优化与正则化(模块 03),然后是 CNN(模块 04)与序列模型(模块 05)两大结构先验家族,最后是工程实践(模块 06)与历史脉络(模块 07)。深度学习相对传统方法的决定性差异在于「端到端」:梯度可以从最终损失一路传回最底层参数,让整个函数链条被统一优化,这是手工特征流水线做不到的。
公式或模型
机器学习的抽象形式如下,本库所有模型都是它的实例:
给定数据集 D = {(x_i, y_i)}
寻找参数 θ,使模型 f_θ(x) 的期望损失最小
min_θ E_(x,y)~D [ L( f_θ(x), y ) ]变量说明:x 为输入张量,y 为目标,L 为损失函数,θ 为全部可学习参数。该式的可微化与求解方式(梯度下降)分别由 kp-007、kp-010 展开。
图示
人工智能 (AI)
└── 机器学习 (ML) ── 规则由数据学出
└── 深度学习 (DL) ── 表示由多层网络学出
├── CNN → 视觉结构先验(模块 04)
├── RNN → 序列结构先验(模块 05)
└── Attention → 全局依赖(模块 05,通往 Transformer)直观类比
把训练想象成「下山」:损失是海拔,参数是你的位置,梯度指向最陡的上坡方向,反向传播是随时报出每个坐标方向坡度的测绘系统,优化器决定你每步走多远。整个库就是在讲这座山的地图、测绘术与走路策略。
实例或案例
同一个「识别手写数字」任务,两条技术路线对比:传统路线需要人工设计「笔画端点检测 → 环洞计数 → HOG 特征 → SVM 分类」流水线,每一环都要专家调试;深度学习路线把原始像素张量直接输入 CNN,网络自己在低层学出边缘、中层学出部件、高层学出数字整体结构,2012 年后前者在几乎所有视觉基准上被后者全面超越(详见 kp-019、kp-031)。
常见误区
- 「深度学习 = 人工智能的全部」:它只是 ML 的一个分支,小数据、强可解释性场景中树模型与统计方法仍常更优。
- 「深度学习是黑箱所以不用理解原理」:正因为它可微、可导、可分析,才学得动;理解原理正是调优能力的天花板。
- 「训练好 = 记住训练集」:目标是泛化,训练集表现好可能只是过拟合(见 kp-013)。
- 「深度学习必须有海量数据」:迁移学习与数据增强可以大幅降低数据需求(见 kp-032、kp-015)。
与其他知识点的关系
本知识点是 kp-002(张量)、kp-005(MLP)、kp-031(历史脉络)的直接入口;「下山类比」会在 kp-010(优化器)中形式化为梯度下降;端到端机制链在 kp-007(反向传播)达到理论核心。
自测题
- 用一句话说清深度学习与经典机器学习在「特征」处理上的本质区别?
答案要点:经典方法由人设计特征、模型只学分类边界;深度学习把特征提取本身作为可学习层,端到端联合优化。
- 「泛化」为什么比「训练集准确率」更重要?
答案要点:模型最终服务于未见数据,训练集上的高分可能只是记忆(过拟合),无法代表真实使用效果。
- 画出「AI ⊃ ML ⊃ DL」的包含关系,并各举一例。
答案要点:AI——早期专家系统;ML——随机森林做信用评分;DL——CNN 做图像分类。
延伸阅读
- Goodfellow、Bengio、Courville《Deep Learning》第 1 章(人民邮电出版社中译本《深度学习》)。
- 周志华《机器学习》(西瓜书)第 1 章,用于对照机器学习全局视角。
学习状态
状态保存在浏览器本地,用于首页与路径页的进度统计。