人工神经元
Warren McCulloch · Walter Pitts
他们把神经元抽象成一个逻辑计算单元:输入累加超过阈值,输出就点亮。
这是连接主义的远点——智能也许不必逐条写规则,而能由许多简单单元连接、涌现出来。
A HISTORY OF MACHINE LEARNING
机器学习这一个世纪,几经长夜,也数度见晓。来路从不是径直向前,而像一条被反复改道的河。有人相信逻辑与规则,有人相信神经的连接,有人把概率、统计与泛化写成工程。 历经两度寒冬,直到数据、算力、模型规模与产品界面在同一刻成熟,这条河才终于漫过堤岸,涌进每个人的世界。
Warren McCulloch · Walter Pitts
他们把神经元抽象成一个逻辑计算单元:输入累加超过阈值,输出就点亮。
这是连接主义的远点——智能也许不必逐条写规则,而能由许多简单单元连接、涌现出来。
Alan Turing
图灵没有直接定义“思考”,而是提出可观察的模仿游戏:若机器在对话中无法被分辨,我们又凭什么否认它?
此后所有路线都在回答同一个问题:智能到底是规则、是经验,还是被表现出来的能力?
John McCarthy · Marvin Minsky · Claude Shannon · Nathaniel Rochester
“人工智能”这个名字在这里被钉下。早期主流更相信逻辑、搜索、定理证明与手写规则。
这不是机器学习本身,却划定了最早的战场:智能,能不能被人类的规则写出来?
Frank Rosenblatt
感知机让机器通过样本自行调整权重,第一次把“从数据中学习”做成了能演示的真实机器。
它让连接主义短暂站上聚光灯,也埋下了后来关于能力边界的争论。
Perceptron
PHOTO · Mark I perceptron
Joseph Weizenbaum
ELIZA 用模式匹配和模板回应,并不真的理解,却让许多人产生了“它懂我”的错觉。
这提醒后来所有大模型使用者:会说话不等于会理解,交互界面本身就能制造智能感。
ELIZA
FIG · ELIZA dialogue
Marvin Minsky · Seymour Papert
《Perceptrons》指出单层感知机的表达能力有限,连 XOR 这类非线性问题都难以处理。
连接主义退潮,符号主义占了上风。神经网络不是被证伪,而是当时还不会有效训练深层网络。
Lighthill Report · ALPAC 余波
机器翻译、通用智能、机器人的承诺纷纷落空,政府资金开始退潮。
寒冬不是某个算法失败,而是“过度承诺 + 缺数据 + 缺算力 + 缺工程闭环”的共同结果。
AI Winter
ARCHIVE · Lighthill Report
MYCIN · XCON · LISP machines
规则系统在医疗诊断、设备配置等窄领域取得商业成功,企业争相把专家知识写进系统。
它证明了规则有价值,也暴露了瓶颈:知识获取难、维护昂贵、遇到新情况就失灵。
Rumelhart · Hinton · Williams
误差从输出层一路反传,用链式法则更新每一层权重,多层网络终于有了主流训练方法。
它回答了 1969 年留下的问题:不是多层网络不行,而是过去还不会训练它。
Expert-system bust · LISP 机器崩盘
专家系统与专用 LISP 机器市场崩塌,规则系统没能像预期那样扩展到广阔世界。
AI 再次学到同一个教训:写规则能解决窄问题,但世界太大,规则永远写不完。
AI Winter II
PHOTO · LISP machine market
Judea Pearl
概率图模型把不确定性、依赖关系与因果推理拉进同一张图里。
统计学习开始成为机器学习的硬骨架:不再只问“规则是什么”,更问“证据有多强”。
Bayes Net
FIG · Bayesian network
Yann LeCun
卷积网络用局部感受野与权重共享处理图像,手写数字识别成为最早的真实落地场景。
神经网络不再只是概念演示,而是在银行支票、邮政 OCR 这类真实系统里工作。
Vladimir Vapnik · Corinna Cortes
支持向量机用最大间隔与核方法处理分类,在小数据、高维任务上极其强势。
这是传统机器学习的高峰之一:优雅的几何直觉、严密的泛化理论、扎实的工程效果。
Sepp Hochreiter · Jürgen Schmidhuber
门控结构让循环网络缓解长距离依赖与梯度消失,序列建模向前迈了一大步。
Transformer 之前,大量语音、翻译、语言任务都靠 RNN / LSTM 这条线撑住。
LSTM
FIG · LSTM gates
Yann LeCun · Léon Bottou · Yoshua Bengio · Patrick Haffner
LeNet-5 把卷积、池化、全连接组合成现代 CNN 的雏形,MNIST 成为教学与基准的入口。
这条线直接连到本书的 MNIST 实战:从手写数字开始,理解神经网络如何学习。
LeNet-5
FIG · LeNet-5 architecture
Leo Breiman
许多棵随机化决策树一起投票,把单棵树的方差压下去,同时保持强悍的工程鲁棒性。
若没有随机森林,机器学习史就会窄成神经网络史。传统 ML 这一支真的长期很强。
Geoffrey Hinton · Yoshua Bengio · Yann LeCun
深层网络、逐层预训练与更好的训练经验,让“deep learning”重新成为可认真下注的路线。
这不是突然的胜利,而是连接主义在寒冬里积累几十年后,重新抬起了头。
Fei-Fei Li · Stanford Vision Lab
大规模标注图像集把视觉识别变成可比较、可竞赛、可持续推进的工程战场。
深度学习的爆发不只靠算法,更靠数据集把问题的规模真正拉大。
Alex Krizhevsky · Ilya Sutskever · Geoffrey Hinton
GPU 上训练的大型 CNN 把 ImageNet top-5 错误率大幅打下来,传统视觉方法一夜失势。
这是现代深度学习的引爆点:数据、GPU 与网络结构,在同一刻对齐。
AlexNet
FIG · AlexNet architecture
Tomas Mikolov · Google
词不再只是一个 ID,而是连续空间里的向量;语义关系可以在向量空间里显出形状。
从 one-hot 到 embedding,语言进入了神经网络真正能处理的几何世界。
Ian Goodfellow
生成器造假,判别器识真,二者对抗训练,让生成式模型第一次进入公众视野。
它把“模型能不能生成逼真样本”变成了深度学习的核心问题之一。
DeepMind · Lee Sedol
深度网络、蒙特卡洛树搜索与强化学习结合,击败了顶尖人类棋手。
它展示了另一条路:不止靠模仿数据,还能靠搜索、环境与自我对弈变强。
Vaswani 等 · Attention Is All You Need
自注意力取代循环结构,让序列里所有 token 可以直接彼此相望。
大模型时代的底座在这里成型:并行、可扩展、天生适合规模化训练。
Transformer
FIG · Transformer architecture
Google · OpenAI
大规模预训练再迁移到下游任务,语言模型从“任务专用”转向“通用底座”。
从这里开始,模型不再只学一个任务,而是先去学习整个语言世界本身。
BERT / GPT
FIG · MLM vs autoregressive
OpenAI
1750 亿参数的语言模型展示 few-shot 能力:许多任务不再单独训练,给几个例子就能做。
它让整个行业真正相信:规模本身,就会改变能力的边界。
GPT-3
FIG · Scaling law
OpenAI · InstructGPT · RLHF
底座模型经指令微调与人类反馈对齐,被放进一个人人会用的对话界面。
机器学习第一次不再只是研究者的工具,而成了普通人日常的入口。
2023 — 至今
ChatGPT 之后,历史不再是单线接力。公司、开源社区、研究实验室与云平台同时开火—— 有人追最强推理,有人押注开源生态,有人深耕长上下文、Agent、代码、语音与多模态。这是一棵还在生长的树。
左侧年份只表示大致演化阶段,不是每个节点的精确发布日期。