从 Transformer 到 V4:两年间发生了什么
2024 年 1 月,一家名不见经传的中国 AI 公司发布了一篇验证缩放定律的论文。两年后的 2026 年,DeepSeek V4 已成为开源大模型领域最具影响力的模型之一。
这不是一个"追风口"的故事——每一步创新都建立在前一步的积累之上。
Transformer 基础回顾
大模型预测下一个 token 的三步流程:
- Embedding — 将 token 转为向量
- MHA(多头注意力) — 向量间加权求和,让每个 token 包含上下文信息
- FFN(前馈神经网络) — 非线性变换
以上两步重复多次(Transformer Block),各层通过残差连接传递信息,最后经 Softmax 得到概率分布,采样得到下一个 token。
V1 — 重新验证 Scaling Law(2024-01)
梁文峰没有急于训练模型,而是从比 Transformer 更底层的 Scaling Law 入手:
- 系统研究了超参数设置(batch size、学习率)、训练数据量、算力的影响
- 顺手训练了 DeepSeek LM(后称 V1),为长期路线奠定基础
核心贡献:不是创新架构,而是验证了缩放定律的完备性,为后续所有改进做了理论铺垫。
DeepSeekMoE — 改造 FFN 层
问题:FFN 是全连接网络,参数量随模型增大而膨胀,占用大量显存。
MOE 基本思想:将 FFN 拆成多个"专家",每个 token 只路由到部分专家。总参数量不变,但实际参与计算的参数大幅减少。
DeepSeek 的改良:
- 更细粒度的专家划分 — 每个专家更小、更专精
- 共享专家机制 — 设置每个 token 都会经过的共享专家,捕获通用知识
V2 — MLA 多头潜在注意力
问题:MHA 中的 KV Cache 是显存占用的大头。
| 已有方案 | 做法 | 问题 |
|---|---|---|
| GQA | 多个头共用一组 KV | 粒度仍然较粗 |
| MQA | 所有头共用一个 KV | 信息损失大 |
MLA 的创新:将所有 token 的 KV 向量先压缩为低维的 latent KV 向量(类似 VAE 压缩图片),使用时再还原。
核心假设:KV 向量存在冗余,是低秩的,可以无损或有损压缩还原。
效果:大幅减少 KV Cache 显存占用,与 MOE 一起为训练更大模型打下低成本基础。
V3 — 性能爆发(671B / 37B 激活)
在 MLA + DeepSeekMoE 的技术积累上:
| 指标 | 值 |
|---|---|
| 总参数量 | 671B(MOE 架构) |
| 激活参数 | 仅 37B(5.5% 参与计算) |
| 训练计算量 | 非常少 |
| 性能 | 比肩前沿闭源模型 |
| 开源 | ✅ |
V3 让 DeepSeek 开始被开源社区广泛关注。
R1 — 纯强化学习催生推理能力
背景:V3 的推理能力不足,业界仅有 OpenAI o1 做了推理模型。
创新训练范式 — 纯强化学习(不用 SFT):
- 传统 SFT:告诉模型正确推理步骤 → 对比损失训练
- DeepSeek 的做法:让模型自由发挥,答对给奖励,答错给惩罚
Aha Moment
训练到一定程度,模型自发涌现了推理能力:
- 学会在输出过程中 "wait wait" → 推翻之前的结论
- 像人类思考一样自我纠错
结合 GRPO(Group Relative Policy Optimization)强化学习算法训练而成。这一篇论文的影响力远超之前所有论文的总和,开创了推理模型的新时代。
MHC — 流形约束的超连接
问题:传统残差连接太死板,深层网络中信息可能已严重扭曲。
字节的 Hyper-Connection 拓宽通道数、用可学习矩阵传递,但不加约束 → 连乘失控 → 梯度爆炸。
DeepSeek 的改进:给学习矩阵加上流形约束(Manifold Constraint),保证矩阵不论怎么连乘都保持在可控范围内,为稳定训练超大规模模型奠定基础。
V3.2 / V4 — 注意力机制的长上下文优化
| 方案 | 思路 | 归类 | 版本 |
|---|---|---|---|
| DSA | 通过策略选择相关 token,而非定死窗口 | 选择策略 | V3.2 |
| CSA | 将历史 token 压缩(类似 MLA 压缩 KV) | 压缩策略 | V4 |
| HCA | 短距离保留原始 token,长距离才压缩 | 压缩策略 | V4 |
技术演进全景
V1 (2024-01) Scaling Law 验证 + DeepSeek LM
↓
MoE 细粒度专家 + 共享专家,优化 FFN 显存
↓
V2 MLA 压缩 KV Cache,优化注意力显存
↓
V3 671B 总参 / 37B 激活,低成本高性能
↓
R1 纯 RL 训练推理能力,Aha Moment,GRPO
↓
MHC 流形约束超连接,稳定深层训练
↓
V3.2 DSA 注意力优化
V4 CSA + HCA 注意力压缩
总结
最初的种子在 2024-01 的 DeepSeek LM 就已埋下。两年后的 V4 只是来时路的总和。没有 V1 的缩放定律验证,就没有 MoE 的参数效率;没有 MLA 的显存压缩,就训不动 671B 的 V3;没有 V3 的基础,R1 的推理涌现就无从谈起。这就是长期主义的价值。
