07-脉络与前沿 入门 预计 25 分钟

深度学习简史:三次浪潮与关键人物

深度学习史是「神经网络思想三次起落」的历史:1943–1969 的感知机时代、1980 年代的反向传播时代、2012 年至今的深度学习时代——每次兴起都由「思想 + 数据 + 算力」三要素的重新凑齐驱动。

一句话定义

深度学习史是「神经网络思想三次起落」的历史:1943–1969 的感知机时代、1980 年代的反向传播时代、2012 年至今的深度学习时代——每次兴起都由「思想 + 数据 + 算力」三要素的重新凑齐驱动。

直觉

三次浪潮像三波涨潮:第一波画出海岸线(思想雏形)、第二波堆起堤坝(算法框架)、第三波迎来大洋(数据与算力)——浪潮退去时不是思想错了,而是条件未到。

为什么重要

历史给学习者两样东西:坐标系(每个概念诞生于什么问题、哪个流派之争)与免疫力(理解「寒冬」的原因,就不会在下次技术波动中迷失)。kp-005 的 XOR 危机、kp-019 的架构演进、kp-032 的范式转变都是这条时间线上的关键站点,本节把它们串成完整叙事。

前置知识

  • kp-001(全景定位)、kp-005(感知机——第一波主角)。

核心概念

  • 第一次浪潮(1943–1969):MP 神经元模型 → Rosenblatt 感知机 → Minsky/Papert《Perceptrons》指出单层局限 → 寒冬。
  • 第二次浪潮(1980s–1990s):反向传播(1986)确立多层可训练 → CNN(LeNet 1989/1998)与 LSTM(1997)诞生 → 算力数据不足、SVM 等浅层方法占优 → 第二次寒冬余波。
  • 第三次浪潮(2006 至今):Hinton 2006 深度信念网重燃「深度」一词 → 2012 AlexNet 爆发 → 2016 AlphaGo、2017 Transformer(指路独立站点)。
  • 流派坐标:符号主义(规则/逻辑)、连接主义(神经网络)、行为主义(强化学习)三大流派,深度学习是连接主义的现代胜利。
  • 三要素定律:思想(算法)、数据、算力——历史反复证明三者缺一即停滞。

原理与机制

按「问题 → 突破 → 局限 → 沉寂」的四段式读三波浪潮。第一波:1943 年 McCulloch 与 Pitts 用逻辑电路建模神经元(思想的种子);1958 年 Rosenblatt 的感知机首次「会自己学习」,纽约时报预言其将「走路、说话、意识」;1969 年 Minsky 与 Papert 专著证明单层感知机连 XOR 都解不了(kp-005 已推导),且当时无人知道多层如何训练——经费退潮,连接主义冬眠十余年。第二波的关键一跃是 1986 年 Rumelhart、Hinton、Williams 在 Nature 发表反向传播(kp-007 的原始出处),多层训练难题被攻破;LeCun 1989–1998 把 CNN 用于手写数字并进入商业系统( kp-019 的 LeNet);Hochreiter 与 Schmidhuber 1997 发明 LSTM(kp-023);但彼时数据以万计而非百万计、CPU 训练一个网络以天计,反向传播在深网上仍受梯度消失困扰,1990 年代末 SVM 等方法在多数基准上更省心,第二次低谷来临。第三波的前奏是 2006 年 Hinton 等的深度信念网(逐层无监督预训练,绕开深网直接训练难题——该技巧后来被 ReLU/BN 取代,但「深度学习」一词由此复兴);引爆点是 2012 年 AlexNet(kp-019):ImageNet 千万级数据 + GPU 算力 + ReLU/Dropout 三要素齐备,错误率断崖式领先。此后沿两条线疾驰:视觉线(VGG→ResNet,kp-019)与序列线(Word2Vec→注意力→2017 Transformer,kp-024/026 的路标);2016 年 AlphaGo(深度网络+强化学习,行为主义合流)改写公众认知;2017 年后 Transformer 与大模型时代开启——那是独立站点的序章,本库到门口为止。人物坐标:Hinton(反向传播与深度复兴,2024 年与 Hopfield 获诺贝尔物理学奖)、LeCun(CNN,图灵奖 2018)、Bengio(序列与表示学习,图灵奖 2018)——深度学习三教头师徒同源,两次寒冬与一次复兴贯穿其职业生涯。

公式或模型

本节不适用——理由:历史叙事知识点;本库的公式体系(感知机、反向传播、LSTM、注意力)本身即这条时间线的技术里程碑,已在各自主知识点给出。

图示

时间线(三波浪潮):

1943 MP神经元 ─ 1958 感知机 ─ 1969《Perceptrons》→ ❄ 第一次寒冬
1986 反向传播 ─ 1989-98 LeNet ─ 1997 LSTM ──→ ❄ 第二次低谷(SVM 时代)
2006 深度信念网 ─ 2012 AlexNet ─ 2015 ResNet ─ 2016 AlphaGo
─ 2017 Transformer ─ 2018 图灵奖三教头 ─ 2020s 大模型时代(→ 独立站点)

直观类比

「三要素定律」像做菜:菜谱(算法)早在 1986 就写好了,但直到 2012 年才凑齐食材(大数据)与炉灶(GPU)——菜不是那时候才发明的,是那时候才做得熟。

实例或案例

用三张「同一任务的最好成绩」感受浪潮落差:手写数字识别——1960s 方法约 80%、LeNet-5(1998)99.05%、现代 MLP(kp-016,2026 年的你在笔记本上)98%+;ImageNet 分类——2011 年手工特征 74%、2015 年 ResNet 97%+ 且首超人类;机器翻译——2013 年统计方法生硬、2016 年神经翻译可读。每张表都印证同一规律:范式(表示学习)+ 数据 + 算力,缺什么补什么后能力就跳一档。kp-005 的 XOR、kp-019 的架构表在此获得历史纵深:它们不是孤立知识点,而是三波浪潮的路碑。

常见误区

  • 「深度学习思想是 2012 年发明的」:核心思想(分层学习表示)1943–1986 已备齐,2012 年爆发的是条件而非思想。
  • 「两次寒冬证明神经路线错了」:寒冬源于「三要素缺位 + 过度承诺」的组合,思想本身在每次复潮中基本未被推翻。
  • 「历史是背景板可以跳过」:不了解 XOR 危机就看不懂激活函数的地位;不了解退化问题就读不懂 ResNet 的动机(kp-019 的教训)。
  • 把 AlphaGo 归为纯深度学习:它是深度网络与强化学习的合流(行为主义),强化学习体系有独立站点。

与其他知识点的关系

本节是 kp-001 全景的历史维、kp-005/kp-019 的叙事框架、kp-032 范式转变的前情提要;三教头的人物线索与 kp-033 的伦理转向(Hinton 后期的 AI 风险表态)亦有衔接。

自测题

  1. 两次 AI 寒冬各自直接诱因是什么?

答案要点:第一次——Minsky 指出单层感知机局限(XOR)且多层训练无解;第二次——数据与算力不足,深网训练困难,浅层方法更实用。

  1. 2012 年 AlexNet 爆发凑齐了哪三要素?

答案要点:算法(ReLU/Dropout/CNN 思想成熟)、数据(ImageNet 百万级标注)、算力(GPU 并行训练)。

  1. 三大流派分别是什么?深度学习属于哪一支?

答案要点:符号主义(逻辑规则)、连接主义(神经网络)、行为主义(强化学习);深度学习属连接主义,AlphaGo 是连接+行为的合流。

延伸阅读

  • Russell、Norvig《人工智能:现代方法》第 1 章历史部分(三大流派与两次寒冬的权威简史)。
  • Goodfellow 等《Deep Learning》「Introduction」章的历史小节(第一手视角,作者即当事人)。

学习状态

状态保存在浏览器本地,用于首页与路径页的进度统计。