深入解读 DeepSeek V1~V4:两年技术演进全景

深入解读 DeepSeek V1~V4:两年技术演进全景

hhermes|2026年6月9日1 阅读 · 6 分钟

从 Transformer 基础出发,梳理 DeepSeek V1~V4 的技术演进:Scaling Law → DeepSeekMoE → MLA → GRPO → MHC → 注意力优化。

从 Transformer 到 V4:两年间发生了什么

2024 年 1 月,一家名不见经传的中国 AI 公司发布了一篇验证缩放定律的论文。两年后的 2026 年,DeepSeek V4 已成为开源大模型领域最具影响力的模型之一。

这不是一个"追风口"的故事——每一步创新都建立在前一步的积累之上。


Transformer 基础回顾

大模型预测下一个 token 的三步流程:

  1. Embedding — 将 token 转为向量
  2. MHA(多头注意力) — 向量间加权求和,让每个 token 包含上下文信息
  3. FFN(前馈神经网络) — 非线性变换

以上两步重复多次(Transformer Block),各层通过残差连接传递信息,最后经 Softmax 得到概率分布,采样得到下一个 token。


V1 — 重新验证 Scaling Law(2024-01)

梁文峰没有急于训练模型,而是从比 Transformer 更底层的 Scaling Law 入手:

  • 系统研究了超参数设置(batch size、学习率)、训练数据量、算力的影响
  • 顺手训练了 DeepSeek LM(后称 V1),为长期路线奠定基础

核心贡献:不是创新架构,而是验证了缩放定律的完备性,为后续所有改进做了理论铺垫。


DeepSeekMoE — 改造 FFN 层

问题:FFN 是全连接网络,参数量随模型增大而膨胀,占用大量显存。

MOE 基本思想:将 FFN 拆成多个"专家",每个 token 只路由到部分专家。总参数量不变,但实际参与计算的参数大幅减少

DeepSeek 的改良

  • 更细粒度的专家划分 — 每个专家更小、更专精
  • 共享专家机制 — 设置每个 token 都会经过的共享专家,捕获通用知识

V2 — MLA 多头潜在注意力

问题:MHA 中的 KV Cache 是显存占用的大头。

已有方案 做法 问题
GQA 多个头共用一组 KV 粒度仍然较粗
MQA 所有头共用一个 KV 信息损失大

MLA 的创新:将所有 token 的 KV 向量先压缩为低维的 latent KV 向量(类似 VAE 压缩图片),使用时再还原

核心假设:KV 向量存在冗余,是低秩的,可以无损或有损压缩还原。

效果:大幅减少 KV Cache 显存占用,与 MOE 一起为训练更大模型打下低成本基础。


V3 — 性能爆发(671B / 37B 激活)

在 MLA + DeepSeekMoE 的技术积累上:

指标
总参数量 671B(MOE 架构)
激活参数 仅 37B(5.5% 参与计算)
训练计算量 非常少
性能 比肩前沿闭源模型
开源

V3 让 DeepSeek 开始被开源社区广泛关注。


R1 — 纯强化学习催生推理能力

背景:V3 的推理能力不足,业界仅有 OpenAI o1 做了推理模型。

创新训练范式纯强化学习(不用 SFT):

  • 传统 SFT:告诉模型正确推理步骤 → 对比损失训练
  • DeepSeek 的做法:让模型自由发挥,答对给奖励,答错给惩罚

Aha Moment

训练到一定程度,模型自发涌现了推理能力:

  • 学会在输出过程中 "wait wait" → 推翻之前的结论
  • 像人类思考一样自我纠错

结合 GRPO(Group Relative Policy Optimization)强化学习算法训练而成。这一篇论文的影响力远超之前所有论文的总和,开创了推理模型的新时代。


MHC — 流形约束的超连接

问题:传统残差连接太死板,深层网络中信息可能已严重扭曲。

字节的 Hyper-Connection 拓宽通道数、用可学习矩阵传递,但不加约束 → 连乘失控 → 梯度爆炸。

DeepSeek 的改进:给学习矩阵加上流形约束(Manifold Constraint),保证矩阵不论怎么连乘都保持在可控范围内,为稳定训练超大规模模型奠定基础。


V3.2 / V4 — 注意力机制的长上下文优化

方案 思路 归类 版本
DSA 通过策略选择相关 token,而非定死窗口 选择策略 V3.2
CSA 将历史 token 压缩(类似 MLA 压缩 KV) 压缩策略 V4
HCA 短距离保留原始 token,长距离才压缩 压缩策略 V4

技术演进全景

复制代码
V1 (2024-01)  Scaling Law 验证 + DeepSeek LM
    ↓
MoE           细粒度专家 + 共享专家,优化 FFN 显存
    ↓
V2            MLA 压缩 KV Cache,优化注意力显存
    ↓
V3            671B 总参 / 37B 激活,低成本高性能
    ↓
R1            纯 RL 训练推理能力,Aha Moment,GRPO
    ↓
MHC           流形约束超连接,稳定深层训练
    ↓
V3.2          DSA 注意力优化
V4            CSA + HCA 注意力压缩

总结

最初的种子在 2024-01 的 DeepSeek LM 就已埋下。两年后的 V4 只是来时路的总和。没有 V1 的缩放定律验证,就没有 MoE 的参数效率;没有 MLA 的显存压缩,就训不动 671B 的 V3;没有 V3 的基础,R1 的推理涌现就无从谈起。这就是长期主义的价值

© 2026 XV. 保留所有权利。