艾伦·图灵
计算机科学与 AI 的共同起点。1950 年用「模仿游戏」把哲学问题转化为可执行的测试,并预判了此后所有主要反对意见。
一项学科的历史,最终是人的历史。下面这些名字大致按「奠基者 → 复兴者 → 当代推动者」排列, 不是一份排名,而是一条思想传承的线索:从「神经元能否计算」,到「网络能否学习」,再到「规模能否带来智能」。
1943–1969。他们大多在有「AI」这个词之前就已经开始工作,贡献是定义了整个领域的问题框架。
计算机科学与 AI 的共同起点。1950 年用「模仿游戏」把哲学问题转化为可执行的测试,并预判了此后所有主要反对意见。
1943 年提出 M-P 神经元模型,第一次证明简单阈值单元组成的网络可以表达任意逻辑命题,连接主义路线由此发端。
信息论创始人,也是 1956 年达特茅斯会议的发起人之一。他让「信息」成为可度量的量,为机器学习提供了损失函数与熵的语言。
1949 年提出赫布学习律:同时激活的神经元连接会被强化。这是反向传播、自组织映射乃至一切「从数据中调整权重」方法的思想原型。
「人工智能」一词的提出者,达特茅斯会议的组织者,LISP 语言的发明者。他坚持用数学逻辑刻画智能,奠定了符号主义四十年的统治地位。
MIT AI 实验室联合创始人,最早实现神经网络硬件的人之一,也是 1969 年《感知机》的作者。他既是连接主义的先驱,也是它第一次寒冬的推手。
1958 年提出感知机与可收敛的学习算法,是「让机器自己调整参数」的第一人。他在 1971 年意外去世,神经网络研究也随之进入长期低谷。
逻辑理论家、通用问题求解器的作者,把「搜索 + 启发式」确立为解决问题的通用方法。西蒙也是唯一同时获得图灵奖与诺贝尔经济学奖的人。
跳棋程序的作者,1959 年提出「机器学习」这一术语。他的程序能通过自我对弈提升棋力,是「机器无需显式编程即可改进」的最早示范。
1980 年代至今。他们解决了「深层网络怎么训练」这个卡了十七年的问题,并把这条路推到工业规模。
反向传播的推广者、深度信念网络的提出者、AlexNet 的导师。四十余年坚持连接主义,在两次寒冬中未曾转向。2023 年离开谷歌以便自由讨论 AI 风险,2024 年获诺贝尔物理学奖。
卷积网络的奠基者,1989 年用手写数字识别证明卷积结构有效。他长期主张「世界模型」路线,认为当前自回归语言模型不足以通向真正的智能。
注意力机制与表征学习的早期推动者之一。近年持续警示先进 AI 的失控风险,是「AI 安全」议题最重要的学术发声者之一。
1982 年用能量函数描述递归网络,把统计物理的方法带入神经网络研究,为 1980 年代连接主义的复苏提供了理论支点。2024 年获诺贝尔物理学奖。
ImageNet 的发起人。她用众包方式构建了千万级标注图像数据集,为深度学习提供了最关键的「燃料」与统一评测场。近年推动「空间智能」与以人为本的 AI。
谷歌大脑与 Coursera 的联合创始人,斯坦福课程与在线公开课让数百万工程师第一次系统学习机器学习。他也是「以数据为中心」这一工程理念的主要倡导者。
DeepMind 联合创始人。AlphaGo 证明强化学习能攻克直觉型博弈,AlphaFold 2 把深度学习变成基础科学的工具。2024 年获诺贝尔化学奖。
AlexNet 作者之一,OpenAI 前首席科学家,是 GPT 系列与「规模定律」路线的核心推动者。他长期关注超级智能的对齐问题,并因此离开 OpenAI 另创研究机构。
深度求索(DeepSeek)创始人。2025 年 1 月开源的 R1 推理模型以显著低于同行的训练成本达到接近前沿的表现,并公开技术细节,改变了「只有巨额算力才能做前沿模型」的行业叙事。
OpenAI 首席执行官。ChatGPT 的产品化与大规模商业化由他主导,也使他成为全球关于 AI 收益分配与监管辩论中最受关注、争议也最多的产业人物之一。
Anthropic 联合创始人兼首席执行官,此前在 OpenAI 参与 GPT-2 / GPT-3 相关工作。他主导的「宪法式 AI」尝试用成文原则替代部分人工标注,是可扩展对齐的一条主流技术路径。
如果只看一条主线,今天所有大模型都可以追溯到 1943 年的那个数学模型。 每一代都在解决上一代留下的具体缺陷——下面每一行的「解决的问题」,就是它存在的理由。
用阈值单元与权重表示简单决策。解决的问题:能否用数学单元表达逻辑;遗留问题:权重靠人工设定,机器不会自己学。
根据分类错误自动更新权重。解决的问题:机器可以自己学;遗留问题:只能处理线性可分问题,多层网络无法训练。
用链式法则把误差逐层回传,训练深层网络成为可能。解决的问题:多层网络的训练;遗留问题:梯度消失、数据太少、算力不足。
卷积共享权重处理图像,门控机制处理长序列。解决的问题:图像与序列的结构化建模;遗留问题:特征仍需标注数据,跨任务迁移困难。
ReLU、Dropout、批量归一化让深网络可训,ImageNet 与 GPU 提供燃料和引擎。解决的问题:规模化训练;遗留问题:每个任务都要重新标注、重新训练。
自注意力取代循环结构,训练可大规模并行;预训练 + 微调让一个模型服务多种任务。解决的问题:并行效率与通用性;遗留问题:输出不可控、不遵循人类意图。
用人类反馈把语言模型对齐成助手,图文音视频统一到同一模型。解决的问题:可用性与交互形态;遗留问题:幻觉、复杂推理薄弱、算力成本高。
在回答前进行长链条思考,用可验证奖励强化推理过程,并让模型调用工具完成多步任务。解决的问题:数学、代码与多步规划;待解问题:可靠性、长任务稳定性与治理。
如果只读十份原始材料,就是这十份。它们分别标记了一个转折点,按时间排列。
| 年份 | 文献 | 作者 | 为什么重要 |
|---|---|---|---|
| 1943 | A Logical Calculus of the Ideas Immanent in Nervous Activity | 麦卡洛克、皮茨 | 第一个人工神经元模型,连接主义的起点 |
| 1950 | Computing Machinery and Intelligence | 图灵 | 把「机器能否思考」变成可操作的测试 |
| 1958 | The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain | 罗森布拉特 | 第一个能从数据中学习的神经网络模型 |
| 1969 | Perceptrons | 明斯基、帕佩特 | 指出单层网络的表达极限,直接引发第一次寒冬 |
| 1986 | Learning Representations by Back-Propagating Errors | 鲁梅尔哈特、辛顿、威廉姆斯 | 让多层网络的训练成为常规操作 |
| 1989 | Backpropagation Applied to Handwritten Zip Code Recognition | 杨立昆等 | 卷积网络的工程起点,今天视觉模型的原型 |
| 2012 | ImageNet Classification with Deep Convolutional Neural Networks | 克里热夫斯基、苏茨克维、辛顿 | AlexNet,深度学习革命的开场 |
| 2015 | Deep Learning(《自然》综述) | 杨立昆、本吉奥、辛顿 | 把深度学习的原理与边界系统化,成为该领域的标准入门文献 |
| 2017 | Attention Is All You Need | 瓦斯瓦尼等(谷歌) | Transformer,此后所有大模型的共同架构 |
| 2022 | Training Language Models to Follow Instructions with Human Feedback | 欧阳龙等(OpenAI) | RLHF 流程的公开说明,ChatGPT 背后的关键方法 |