大语言模型演进史
从 GPT-1 到 GPT-4,从 BERT 到 LLaMA,大语言模型在短短几年内彻底改变了 AI 格局。
Transformer 的诞生(2017)
- "Attention is All You Need"(Vaswani et al.)
- 为后续所有 LLM 奠定架构基础
GPT 系列演进
GPT-1(2018,117M 参数)
- 首次将 Transformer Decoder 用于语言模型
- 无监督预训练 + 有监督微调范式
- 在 8 个 NLP 任务中 7 个达到 SOTA
GPT-2(2019,1.5B 参数)
- 更大规模数据和模型,展示零样本迁移能力
- 因安全考虑延迟发布("too dangerous to release")
- 核心:Zero-shot 能力涌现
GPT-3(2020,175B 参数)
- 规模大幅提升,展示强大 Few-shot 能力
- In-Context Learning(上下文学习)现象
- 无需微调,通过 Prompt 即可完成各种任务
- 能力涌现(Emergent Abilities):超过一定规模后才出现的能力
InstructGPT / GPT-3.5(2022)
- Instruction Tuning + RLHF(人类反馈强化学习)
- 更好的指令遵循能力,减少有害输出
- text-davinci-003 / ChatGPT 的基础
GPT-4(2023)
- 多模态能力(文本+图像输入)
- 在各种考试中表现优异(Bar Exam、SAT 等)
- 更长的上下文窗口(8K/32K/128K tokens)
- 更安全的对齐训练
BERT(2018,Encoder-only)
- Bidirectional Encoder Representations from Transformers
- 使用 Masked Language Model(MLM)+ Next Sentence Prediction(NSP)
- 编码器架构:双向上下文理解
- 更适合理解类任务(分类、序列标注、QA)
BERT vs GPT 架构对比
| 维度 | BERT(Encoder) | GPT(Decoder) |
|---|---|---|
| 注意力 | 双向(Bidirectional) | 单向(Causal) |
| 预训练任务 | MLM + NSP | 自回归语言建模 |
| 适合任务 | 理解类(分类/标注/QA) | 生成类(文本生成/对话) |
| 能力涌现 | 较弱 | 强(随规模增长涌现) |
Scaling Law(缩放定律)
- Kaplan et al.(2020):模型性能随参数量/数据量/计算量呈幂律关系
- 核心发现:在计算预算最优分配下,应同等放大模型和数据
- 指导了 GPT-3 等大模型的设计
Chinchilla 定律(2022,DeepMind)
- Hoffman et al.:大多数 LLM 训练不足(undertrained)
- 对 70+ 种参数量和 token 数的组合进行实验
- 结论:在固定计算预算下,模型大小和数据量应等比缩放
- Chinchilla(70B)使用 1.4T tokens,超越 GPT-3(175B)
涌现能力(Emergent Abilities)
- 思维链(Chain-of-Thought)
- 上下文学习(In-Context Learning)
- 指令遵循(Instruction Following)
- 工具使用(Tool Use)
- 这些能力在小模型中不存在,在超过某个规模后突然出现
总结
| 模型 | 发布时间 | 参数量 | 架构 | 关键贡献 |
|---|---|---|---|---|
| GPT-1 | 2018 | 117M | Decoder-only | 无监督预训练 + 有监督微调范式 |
| BERT | 2018 | 340M | Encoder-only | 双向上下文理解,MLM 预训练 |
| GPT-2 | 2019 | 1.5B | Decoder-only | Zero-shot 能力涌现 |
| GPT-3 | 2020 | 175B | Decoder-only | Few-shot / In-Context Learning |
| Chinchilla | 2022 | 70B | Decoder-only | 缩放定律修正,训练要充分 |
| GPT-4 | 2023 | 未公开 | Decoder-only(MoE) | 多模态,长上下文,对齐训练 |