发现·AI·产品

大模型的历史
——从神经网络到 Transformer 的三十年

大模型不是凭空出现的——它是半个世纪研究积累的必然产物。理解它从哪里来,才能判断它可能到哪里去。

这个模式解决什么问题
  • "Transformer""注意力机制""自回归"——名词满天飞,却看不清彼此的关系
  • 每次新模型发布都以为"这次不一样",实际上脉络早有迹可循
  • 不知道哪些技术是"已成熟"的,哪些是"还在探索"的

三个里程碑

从感知机到大模型,AI 历史可浓缩为三次"能力跃迁"。每一次跃迁的背后,是计算力、数据量、算法三者的共振。

1958 感知机 单层网络 1986 反向传播 多层可训练 2012 深度卷积 ImageNet 突破 2017 Transformer 大模型起点
四个关键节点——每一次跃迁都把"AI 能做到什么"的边界推远。
  • 1958 · 感知机用线性权重从输入预测输出——第一次让"学习"变成数学问题。受限于无法处理异或问题,陷入第一次寒冬。
  • 1986 · 反向传播让多层网络可以被训练。从"能学一件事"到"能学抽象特征"——深度学习的大门由此打开。
  • 2012 · AlexNetGPU + 大数据让深度卷积网络在图像识别上碾压传统方法。AI 走出实验室,开始进入产业。
  • 2017 · Transformer注意力机制抛弃了时序限制,让并行训练成为可能。从此大模型一发不可收拾。

为什么 Transformer 改变了游戏

Transformer 的核心创新只有一个词:注意力。它让模型在处理每一个词时,可以选择性地关注上下文中的其他任何词——不再受限于"相邻"或"固定距离"。

架构核心机制能做什么代表
RNN时序记忆语音、文本LSTM
CNN局部卷积图像、语音AlexNet
Transformer全局注意力一切序列GPT, BERT
从"处理什么"到"能处理什么"——架构决定了能力的天花板。

真实案例

RNN 处理长文本
依次处理,记不住太远的内容

RNN 按顺序处理每个词,长文本中前面的信息容易丢失——训练也慢。

Transformer 全局注意力
并行处理,任何两词都可以"直接对话"

每个词同时看到全文——既能抓住长距离依赖,又能充分利用并行计算。这就是 GPT 系列的基础。

给 AI 的话

PROMPT · 快速理解
请画一条时间线,标注 AI 历史上的 5 个关键节点:
- 每个节点:年份、发明者、一句话说明为什么重要
- 特别关注:从"小模型"到"大模型"的转折点在哪里
- 用中文输出

← AI 是什么 提示词的哲学 →