大模型的历史
——从神经网络到 Transformer 的三十年
大模型不是凭空出现的——它是半个世纪研究积累的必然产物。理解它从哪里来,才能判断它可能到哪里去。
这个模式解决什么问题
- "Transformer""注意力机制""自回归"——名词满天飞,却看不清彼此的关系
- 每次新模型发布都以为"这次不一样",实际上脉络早有迹可循
- 不知道哪些技术是"已成熟"的,哪些是"还在探索"的
三个里程碑
从感知机到大模型,AI 历史可浓缩为三次"能力跃迁"。每一次跃迁的背后,是计算力、数据量、算法三者的共振。
- 1958 · 感知机用线性权重从输入预测输出——第一次让"学习"变成数学问题。受限于无法处理异或问题,陷入第一次寒冬。
- 1986 · 反向传播让多层网络可以被训练。从"能学一件事"到"能学抽象特征"——深度学习的大门由此打开。
- 2012 · AlexNetGPU + 大数据让深度卷积网络在图像识别上碾压传统方法。AI 走出实验室,开始进入产业。
- 2017 · Transformer注意力机制抛弃了时序限制,让并行训练成为可能。从此大模型一发不可收拾。
为什么 Transformer 改变了游戏
Transformer 的核心创新只有一个词:注意力。它让模型在处理每一个词时,可以选择性地关注上下文中的其他任何词——不再受限于"相邻"或"固定距离"。
| 架构 | 核心机制 | 能做什么 | 代表 |
|---|---|---|---|
| RNN | 时序记忆 | 语音、文本 | LSTM |
| CNN | 局部卷积 | 图像、语音 | AlexNet |
| Transformer | 全局注意力 | 一切序列 | GPT, BERT |
真实案例
RNN 处理长文本
RNN 按顺序处理每个词,长文本中前面的信息容易丢失——训练也慢。
Transformer 全局注意力
每个词同时看到全文——既能抓住长距离依赖,又能充分利用并行计算。这就是 GPT 系列的基础。
给 AI 的话
PROMPT · 快速理解
请画一条时间线,标注 AI 历史上的 5 个关键节点: - 每个节点:年份、发明者、一句话说明为什么重要 - 特别关注:从"小模型"到"大模型"的转折点在哪里 - 用中文输出