ML · A HISTORY 机器学习群星史
00 / 00 技术史前传

A HISTORY OF MACHINE LEARNING

百年长夜
与黎明

机器学习这一个世纪,几经长夜,也数度见晓。来路从不是径直向前,而像一条被反复改道的河。有人相信逻辑与规则,有人相信神经的连接,有人把概率、统计与泛化写成工程。 历经两度寒冬,直到数据、算力、模型规模与产品界面在同一刻成熟,这条河才终于漫过堤岸,涌进每个人的世界。

1943连接

人工神经元

Warren McCulloch · Walter Pitts

他们把神经元抽象成一个逻辑计算单元:输入累加超过阈值,输出就点亮。

这是连接主义的远点——智能也许不必逐条写规则,而能由许多简单单元连接、涌现出来。

人工神经元与感知机结构示意 人工神经元 FIG · 感知机 / 神经元
1950问题

机器能思考吗?

Alan Turing

图灵没有直接定义“思考”,而是提出可观察的模仿游戏:若机器在对话中无法被分辨,我们又凭什么否认它?

此后所有路线都在回答同一个问题:智能到底是规则、是经验,还是被表现出来的能力?

艾伦·图灵肖像 Alan Turing PORTRAIT · A. M. Turing
1956符号

达特茅斯会议

John McCarthy · Marvin Minsky · Claude Shannon · Nathaniel Rochester

“人工智能”这个名字在这里被钉下。早期主流更相信逻辑、搜索、定理证明与手写规则。

这不是机器学习本身,却划定了最早的战场:智能,能不能被人类的规则写出来?

达特茅斯会议 Dartmouth FIG · Dartmouth 1956
1957连接

感知机点燃想象

Frank Rosenblatt

感知机让机器通过样本自行调整权重,第一次把“从数据中学习”做成了能演示的真实机器。

它让连接主义短暂站上聚光灯,也埋下了后来关于能力边界的争论。

Frank Rosenblatt 与 Mark I 感知机 Perceptron PHOTO · Mark I perceptron
1966符号

ELIZA 的对话幻觉

Joseph Weizenbaum

ELIZA 用模式匹配和模板回应,并不真的理解,却让许多人产生了“它懂我”的错觉。

这提醒后来所有大模型使用者:会说话不等于会理解,交互界面本身就能制造智能感。

Joseph Weizenbaum 演示 ELIZA ELIZA FIG · ELIZA dialogue
1969争论

感知机受挫

Marvin Minsky · Seymour Papert

《Perceptrons》指出单层感知机的表达能力有限,连 XOR 这类非线性问题都难以处理。

连接主义退潮,符号主义占了上风。神经网络不是被证伪,而是当时还不会有效训练深层网络。

马文·明斯基肖像 Perceptrons PORTRAIT · M. Minsky
1974寒冬

第一次 AI 寒冬

Lighthill Report · ALPAC 余波

机器翻译、通用智能、机器人的承诺纷纷落空,政府资金开始退潮。

寒冬不是某个算法失败,而是“过度承诺 + 缺数据 + 缺算力 + 缺工程闭环”的共同结果。

Lighthill Report 与第一次 AI 寒冬 AI Winter ARCHIVE · Lighthill Report
1980符号

专家系统繁荣

MYCIN · XCON · LISP machines

规则系统在医疗诊断、设备配置等窄领域取得商业成功,企业争相把专家知识写进系统。

它证明了规则有价值,也暴露了瓶颈:知识获取难、维护昂贵、遇到新情况就失灵。

专家系统/贝叶斯规则示意 Expert Systems FIG · 专家系统
1986连接

反向传播复兴

Rumelhart · Hinton · Williams

误差从输出层一路反传,用链式法则更新每一层权重,多层网络终于有了主流训练方法。

它回答了 1969 年留下的问题:不是多层网络不行,而是过去还不会训练它。

杰弗里·辛顿肖像 Backprop PORTRAIT · G. Hinton
1987寒冬

第二次 AI 寒冬

Expert-system bust · LISP 机器崩盘

专家系统与专用 LISP 机器市场崩塌,规则系统没能像预期那样扩展到广阔世界。

AI 再次学到同一个教训:写规则能解决窄问题,但世界太大,规则永远写不完。

Symbolics LISP machine AI Winter II PHOTO · LISP machine market
1988连接

贝叶斯网络

Judea Pearl

概率图模型把不确定性、依赖关系与因果推理拉进同一张图里。

统计学习开始成为机器学习的硬骨架:不再只问“规则是什么”,更问“证据有多强”。

贝叶斯网络有向图示意 Bayes Net FIG · Bayesian network
1989连接

CNN 识别手写数字

Yann LeCun

卷积网络用局部感受野与权重共享处理图像,手写数字识别成为最早的真实落地场景。

神经网络不再只是概念演示,而是在银行支票、邮政 OCR 这类真实系统里工作。

杨立昆肖像 CNN PORTRAIT · Y. LeCun
1995连接

SVM 与最大间隔

Vladimir Vapnik · Corinna Cortes

支持向量机用最大间隔与核方法处理分类,在小数据、高维任务上极其强势。

这是传统机器学习的高峰之一:优雅的几何直觉、严密的泛化理论、扎实的工程效果。

支持向量机最大间隔示意 SVM FIG · 最大间隔
1997连接

LSTM 记住更远的东西

Sepp Hochreiter · Jürgen Schmidhuber

门控结构让循环网络缓解长距离依赖与梯度消失,序列建模向前迈了一大步。

Transformer 之前,大量语音、翻译、语言任务都靠 RNN / LSTM 这条线撑住。

LSTM 门控结构示意 LSTM FIG · LSTM gates
1998连接

LeNet-5 与 MNIST

Yann LeCun · Léon Bottou · Yoshua Bengio · Patrick Haffner

LeNet-5 把卷积、池化、全连接组合成现代 CNN 的雏形,MNIST 成为教学与基准的入口。

这条线直接连到本书的 MNIST 实战:从手写数字开始,理解神经网络如何学习。

LeNet-5 网络结构示意 LeNet-5 FIG · LeNet-5 architecture
2001连接

随机森林

Leo Breiman

许多棵随机化决策树一起投票,把单棵树的方差压下去,同时保持强悍的工程鲁棒性。

若没有随机森林,机器学习史就会窄成神经网络史。传统 ML 这一支真的长期很强。

随机森林集成示意 Random Forest FIG · 随机森林
2006连接

深度学习回归

Geoffrey Hinton · Yoshua Bengio · Yann LeCun

深层网络、逐层预训练与更好的训练经验,让“deep learning”重新成为可认真下注的路线。

这不是突然的胜利,而是连接主义在寒冬里积累几十年后,重新抬起了头。

杰弗里·辛顿肖像 Deep Learning PORTRAIT · G. Hinton
2009连接

ImageNet 点燃数据时代

Fei-Fei Li · Stanford Vision Lab

大规模标注图像集把视觉识别变成可比较、可竞赛、可持续推进的工程战场。

深度学习的爆发不只靠算法,更靠数据集把问题的规模真正拉大。

ImageNet 大规模图像数据集 ImageNet FIG · ImageNet
2012连接

AlexNet 碾压 ImageNet

Alex Krizhevsky · Ilya Sutskever · Geoffrey Hinton

GPU 上训练的大型 CNN 把 ImageNet top-5 错误率大幅打下来,传统视觉方法一夜失势。

这是现代深度学习的引爆点:数据、GPU 与网络结构,在同一刻对齐。

AlexNet block diagram AlexNet FIG · AlexNet architecture
2013连接

word2vec

Tomas Mikolov · Google

词不再只是一个 ID,而是连续空间里的向量;语义关系可以在向量空间里显出形状。

从 one-hot 到 embedding,语言进入了神经网络真正能处理的几何世界。

word2vec 词向量空间 word2vec FIG · 词向量空间
2014连接

GAN:两个网络的博弈

Ian Goodfellow

生成器造假,判别器识真,二者对抗训练,让生成式模型第一次进入公众视野。

它把“模型能不能生成逼真样本”变成了深度学习的核心问题之一。

生成对抗网络示意 GAN FIG · 对抗生成
2016连接

AlphaGo 击穿围棋

DeepMind · Lee Sedol

深度网络、蒙特卡洛树搜索与强化学习结合,击败了顶尖人类棋手。

它展示了另一条路:不止靠模仿数据,还能靠搜索、环境与自我对弈变强。

李世石对弈 AlphaGo AlphaGo PORTRAIT · Lee Sedol
2017连接

Transformer

Vaswani 等 · Attention Is All You Need

自注意力取代循环结构,让序列里所有 token 可以直接彼此相望。

大模型时代的底座在这里成型:并行、可扩展、天生适合规模化训练。

Transformer architecture diagram Transformer FIG · Transformer architecture
2018连接

BERT 与 GPT

Google · OpenAI

大规模预训练再迁移到下游任务,语言模型从“任务专用”转向“通用底座”。

从这里开始,模型不再只学一个任务,而是先去学习整个语言世界本身。

BERT 与 GPT 预训练目标对比 BERT / GPT FIG · MLM vs autoregressive
2020连接

GPT-3 与 Scaling

OpenAI

1750 亿参数的语言模型展示 few-shot 能力:许多任务不再单独训练,给几个例子就能做。

它让整个行业真正相信:规模本身,就会改变能力的边界。

Neural scaling law plot GPT-3 FIG · Scaling law
2022连接

ChatGPT 引爆大众世界

OpenAI · InstructGPT · RLHF

底座模型经指令微调与人类反馈对齐,被放进一个人人会用的对话界面。

机器学习第一次不再只是研究者的工具,而成了普通人日常的入口。

ChatGPT 对话界面 ChatGPT FIG · 对话界面

2023 — 至今

一条线,裂成一片星图

ChatGPT 之后,历史不再是单线接力。公司、开源社区、研究实验室与云平台同时开火—— 有人追最强推理,有人押注开源生态,有人深耕长上下文、Agent、代码、语音与多模态。这是一棵还在生长的树。

左侧年份只表示大致演化阶段,不是每个节点的精确发布日期。

OpenAI logoOAIGPT-3 OpenAI logoOAIChatGPT OpenAI logoOAIGPT-5.4 Google logoGGemini 3.5 Google logoGBard Anthropic logoAClaude 5 Meta logoMLlama Mistral AI logoMMistral Qwen logoQQwen DeepSeek logoDSDeepSeek
开放权重 / 开源生态 闭源产品 / 实验室路线