开源大模型生态
开源 LLM 生态蓬勃发展,从 LLaMA 到 Qwen 再到 DeepSeek,开源模型正在逼近甚至在某些方面超越闭源模型。
LLaMA 系列(Meta)
LLaMA(2023,7B/13B/33B/65B)
- 训练数据:仅使用公开可用的数据,完全不依赖专有或人工标注数据
- 65B 参数:在多数基准测试上超越 GPT-3(175B),证明了小模型 + 大数据策略的有效性
- 关键思想:在给定计算预算下,使用更多数据训练较小模型比使用较少数据训练大模型效果更好
- 许可证:非商业许可(研究用途)
LLaMA 2(2023,7B/13B/70B)
- 训练数据:2 万亿 token(比 LLaMA 多 40%)
- 架构改进:引入分组查询注意力(Grouped Query Attention, GQA),提升推理效率
- 上下文长度:4K tokens
- LLaMA 2-Chat:通过 RLHF(基于人类反馈的强化学习)对齐的开源聊天模型
- 许可:宽松社区许可(免费商用)
LLaMA 3 / 3.1(2024,8B/70B/405B)
- LLaMA 3:15T+ token 训练,沿用分组查询注意力,词汇量扩展至 128K
- LLaMA 3.1 405B:首个 400B+ 参数的开源模型,原生支持 128K 上下文窗口
- 基准表现:在多项基准上与 GPT-4 竞争,部分任务甚至超越
- 对齐方法:使用监督微调(SFT)+ 直接偏好优化(DPO)
Qwen 系列(阿里巴巴)
Qwen(2023,1.8B/7B/14B/72B)
- 训练数据:3T token,覆盖中文、英文及多语言
- 能力特点:强大的工具使用能力和代码生成能力
- Qwen-VL:多模态版本,支持图像理解
Qwen 2(2024)
- 架构改进:SwiGLU 激活函数 + GQA + RMSNorm
- 能力提升:更好的多语言支持,数学推理和代码能力显著增强
- Qwen 2.5:进一步优化推理能力、长上下文支持和 Agent 能力
- 72B 版本在多项基准上逼近 LLaMA 3 70B
- 支持 128K 上下文长度
DeepSeek 系列(深度求索)
DeepSeek(2023-2024)
- DeepSeek LLM:67B 参数,在代码和数学推理上表现突出
- DeepSeek-V2:采用 MoE(混合专家)架构,总参数 236B,每个 token 激活 21B 参数
- 创新性地引入 Multi-head Latent Attention(MLA),大幅降低 KV Cache 显存占用
- 训练成本仅为同等性能 Dense 模型的 1/3
- DeepSeek-Coder:专注代码生成,在 HumanEval 等代码基准上表现优异
DeepSeek R1
- 核心创新:通过强化学习驱动推理能力,无需大规模监督数据
- 能力特点:展示出类似 OpenAI o1 的"慢思考"能力,在数学推理、逻辑推理等任务上表现突出
- 训练方法:DeepSeek-R1-Zero 为纯 RL 版本,R1 为结合冷启动数据 + RL 的版本
- 开源贡献:完整开源模型权重和训练管线
Mistral 系列(Mistral AI)
Mistral 7B(2023)
- 性能:发布时在所有 7B 参数模型中表现最佳,性能超越 LLaMA 2 13B
- 创新架构:滑动窗口注意力(Sliding Window Attention),有效降低计算复杂度
- 许可:通过 Apache 2.0 许可发布,完全开源可商用
Mixtral 8x7B(MoE)
- 架构:混合专家(Mixture of Experts),8 个专家,每 token 激活其中 2 个
- 参数:总参数 47B,激活参数仅 12.9B,推理效率极高
- 性能:超越 LLaMA 2 70B 和 GPT-3.5,推理速度与 12.9B Dense 模型相当
- Mixtral 8x22B:升级版,总参数 141B,激活参数 39B,支持多语言和代码
Yi 系列(零一万物)
- Yi 6B / 34B:中英文双语能力优秀,在开源社区中广受好评
- 34B 版本在多项基准上可与 LLaMA 2 70B 竞争
- Yi-VL:多模态版本,支持图文理解
- 许可:Apache 2.0 许可
Gemma 系列(Google)
- Gemma 2B / 7B:基于 Gemini 相同的研究和技术积累开发
- 轻量级设计,适合研究和实验
- Gemma 2:性能大幅提升
- 引入知识蒸馏训练技术
- 27B 版本在同类模型中表现突出
- 特点:开源、轻量、适合学术研究,提供免费商用许可
模型对比总表
| 模型 | 参数量 | 上下文长度 | 开源许可 | 关键特点 |
|---|---|---|---|---|
| LLaMA 3.1 405B | 405B | 128K | 社区许可 | 首个 400B+ 开源模型,逼近 GPT-4 |
| LLaMA 3 70B | 70B | 128K | 社区许可 | 15T+ token 训练,DPO 对齐 |
| Qwen 2.5 72B | 72B | 128K | Apache 2.0 | 中英文双优,Agent 能力强 |
| DeepSeek-V2 | 236B (21B 激活) | 128K | MIT | MoE 架构,MLA 高效推理 |
| Mixtral 8x22B | 141B (39B 激活) | 65K | Apache 2.0 | MoE 架构,高效推理 |
| Yi 34B | 34B | 4K | Apache 2.0 | 双语优秀,可商用 |
| Gemma 2 27B | 27B | 8K | 免费商用 | 基于 Gemini 技术,轻量高效 |
基准性能参考(近似值):
| 模型 | MMLU | GSM8K | HumanEval |
|---|---|---|---|
| LLaMA 3.1 405B | ~87% | ~96% | ~89% |
| LLaMA 3 70B | ~82% | ~93% | ~82% |
| Qwen 2.5 72B | ~85% | ~95% | ~85% |
| DeepSeek-V2 | ~81% | ~92% | ~83% |
| Mixtral 8x22B | ~78% | ~89% | ~77% |
| Yi 34B | ~76% | ~82% | ~74% |
| Gemma 2 27B | ~75% | ~86% | ~72% |
注:以上基准分数为近似值,实际结果可能因评测配置、模型版本和 prompt 策略不同而有差异。
如何选择合适的开源模型
根据任务类型
- 通用聊天 / 对话:LLaMA 3.1 405B、Qwen 2.5 72B(中文场景)
- 代码生成:DeepSeek-Coder、LLaMA 3 70B、Qwen 2.5-Coder
- 数学推理:DeepSeek R1、LLaMA 3.1、Qwen 2.5-Math
- 翻译 / 多语言:Qwen 系列(中文最佳)、Mistral 系列(欧洲语言最佳)
根据部署资源
- 消费级 GPU(< 16GB VRAM):Mistral 7B、Gemma 2 7B、Qwen 2.5 7B、LLaMA 3 8B
- 企业级 GPU(24-48GB VRAM):Mixtral 8x7B、Yi 34B、LLaMA 3 70B(量化后)
- 多 GPU 集群(80GB+ VRAM):LLaMA 3.1 405B、DeepSeek-V2、Mixtral 8x22B
根据语言偏好
- 中文优先:Qwen 系列(最佳)、Yi 系列、DeepSeek 系列
- 英文优先:LLaMA 系列、Mistral 系列、Gemma 系列
- 多语言支持:Qwen 系列、Mistral 系列(欧洲语言)
总结
开源大模型生态正在经历前所未有的繁荣:
- 性能突破:从 LLaMA 65B 超越 GPT-3 到 LLaMA 3.1 405B 逼近 GPT-4,开源模型的进步速度惊人
- 架构创新:MoE(Mixtral、DeepSeek-V2)、GQA(LLaMA 2/3)、滑动窗口注意力(Mistral)等技术不断涌现
- 中文生态:以 Qwen 和 DeepSeek 为代表的中文开源模型已跻身世界一流水平
- 推理增强:DeepSeek R1 开创了开源模型在推理能力上的新范式
- 商业友好:Apache 2.0 许可成为主流,降低了企业采用门槛
未来,随着开源社区持续贡献和更多企业和研究机构加入,开源模型与闭源模型之间的差距有望进一步缩小,甚至在某些领域实现超越。