DeepSeek 技术全景:从 67B 稠密模型到 1.6T 稀疏模型的三年演进

4811 字
24 分钟
DeepSeek 技术全景:从 67B 稠密模型到 1.6T 稀疏模型的三年演进

为什么需要一张 DeepSeek 技术地图#

如果只看单一论文,DeepSeek 的每一项技术(MLA、DeepSeekMoE、DSA 稀疏注意力、MTP 投机解码)都值得单独拆解;但把它们放到时间线上看,会呈现出一条异常清晰的递进逻辑:每代模型只做一两件关键架构升级,其余部分尽量复用,用工程效率把推理成本压到极致。从 2023 年 11 月的 67B 稠密模型,到 2026 年 4 月的 1.6T 稀疏模型,三年间 DeepSeek 的技术路线几乎没有摇摆过。

这篇文章是一张”技术地图”:按发布时间顺序,把 DeepSeek 从第一篇论文到今天所有关键技术梳理一遍——每项技术是什么、解决什么问题、大致怎么做的。按用户要求,本文只做全景概括,不展开细节推导;侧重推理侧的加速与优化。每一项技术后续都会在文章板块以单篇深度拆解的形式补齐(文末列出了本站已完成的对应文章)。

2023 年 11 月:DeepSeek LLM 67B 与 DeepSeek Coder——稠密模型的起点#

DeepSeek 的起点相当朴素。2023 年 11 月发布了两个稠密(Dense)Transformer 模型:DeepSeek Coder(代码模型,最大 33B,16K 上下文)与 DeepSeek LLM 67B(通用模型)。它们确立了 DeepSeek 的两个长期习惯:数据集规模按”万亿 token”级别规划,以及全链路技术细节公开。这一时期没有推理侧的特殊设计,是标准的 MHA 稠密模型。

2024 年 1 月:DeepSeekMoE——细粒度专家分割与共享专家#

DeepSeekMoE(2024 年 1 月)是第一次架构转向,回答的是标准 MoE(如 GShard)的老问题:专家”一整块”前馈网络,激活粗、路由分散、专家之间知识冗余。两个核心设计:

  1. 细粒度专家分割(Fine-Grained Expert Segmentation):把一个大专家切成多个小专家,同样的计算预算下激活更多更小的专家,组合更灵活;
  2. 共享专家隔离(Shared Expert Isolation):设少量始终激活的共享专家负责通用知识,路由专家专注专业化分工,避免冗余;
  3. 归一化 Sigmoid 门控:用归一化后的 Sigmoid 输出替代传统 softmax 门控,缓解路由专家间的负载与知识冗余问题。

DeepSeekMoE 架构图解:左为传统 top-2 路由 MoE,中为细粒度专家分割,右为细粒度分割 + 共享专家
DeepSeekMoE 架构图解:左为传统 top-2 路由 MoE,中为细粒度专家分割,右为细粒度分割 + 共享专家

图:DeepSeekMoE 论文 Figure 2——三种 MoE 层结构的对比(图片来源:DeepSeekMoE 论文

对推理的意义:总参数可以很大,但每 token 只激活一小部分专家——671B 的模型每 token 只激活 37B,推理算力需求大幅下降。这套”细粒度 + 共享专家”的骨架此后被 V2、V3、V4 一路沿用。

2024 年 2 月:DeepSeekMath——GRPO 的诞生#

DeepSeekMath(2024 年 2 月)表面是数学模型,实际提出了 GRPO(Group Relative Policy Optimization,组相对策略优化)——一种去掉价值模型的强化学习算法,用组内采样的相对表现做优势估计。GRPO 属于训练侧方法,此后所有 DeepSeek 模型沿用;它对推理的间接影响是造就了 R1 这类推理模型(见后文),本文不展开训练细节。

2024 年 3 月:DeepSeek-VL——多模态的起点#

DeepSeek-VL(2024 年 3 月,arXiv:2403.05525):DeepSeek 在多模态上的第一次尝试,视觉-语言(Vision-Language)架构,1.3B/7B 视觉语言模型。这条线后来在 Janus 系列与 DeepSeek-OCR 上开花结果。

2024 年 5 月:DeepSeek-V2——MLA 低秩压缩,把注意力成本打下来#

DeepSeek-V2(2024 年 5 月)是第一个里程碑:DeepSeekMoE 处理”算力”问题,新提出的 MLA(Multi-head Latent Attention,多头潜在注意力) 处理”显存与带宽”问题。

在 MLA 之前,长上下文推理的瓶颈在于 KV Cache:MHA 每个头都存一份完整 K、V,序列越长显存越大,解码阶段每次生成一个 token 都要把整段 KV 读回片上(内存带宽受限)。GQA/MQA 用”多个查询头共享一组 KV 头”压缩,但那是离散压缩——共享组内信息全部丢失。

MLA 的思路是低秩连续压缩:先用低秩矩阵把输入压缩成一份共享潜在向量 ctc_t,再从 ctc_t 上投影出每个头的 K、V。推理时只需缓存低维的 ctc_t 和少量用于 RoPE 的解耦向量,每 token 的 KV 缓存从 MHA 的 2nhdh2 n_h d_h 降到 dc+dhRd_c + d_h^R(V2 中约 576 维 vs 8192 维),缩减约 93.3%(1024 长度下 KV 缓存从约 5.2GB 降至 765MB,约 15%),比 GQA 高一个数量级且不丢信息。工程上还有”矩阵吸收”技巧:把 WUKW^{UK}WUVW^{UV} 吸收进查询/输出投影,推理时注意力模块的 FLOPs 反而比标准 MHA 更少。本站的 MLA 完全拆解 有完整推导。

DeepSeek-V2 整体架构:左侧 Transformer 主干,右侧 MLA 与 DeepSeekMoE 两个核心模块的位置关系
DeepSeek-V2 整体架构:左侧 Transformer 主干,右侧 MLA 与 DeepSeekMoE 两个核心模块的位置关系

图:DeepSeek-V2 论文 Figure 2——整体架构示意图(图片来源:DeepSeek-V2 论文

四种注意力机制对比:MHA、GQA、MQA 与 MLA 的 KV 缓存结构差异
四种注意力机制对比:MHA、GQA、MQA 与 MLA 的 KV 缓存结构差异

图:DeepSeek-V2 论文 Figure 3——MLA 用低秩潜在向量联合压缩全部 KV 头(图片来源:DeepSeek-V2 论文

V2 是 236B 总参数(21B 激活)的 MoE,上下文 128K(用 YaRN 扩展)。推理成本打下来的直接结果,是官方 API 价格压到一个数量级以下——“DeepSeek 价格屠夫”称号由此而来,而价格能压下来的根本原因就是 MLA 把推理显存和带宽需求砍到了 1/10 量级。

2024 年 9 月–12 月:V2.5、多模态与 R1-Lite——过渡与预告#

  • DeepSeek-V2.5(2024 年 9 月):把 DeepSeek-Coder-V2 与 V2-Chat 合并为通用模型;
  • Janus(2024 年 10 月,arXiv:2410.13848):视觉编码解耦——用两条独立的视觉编码路径分别处理”理解”与”生成”任务,单一自回归 Transformer 架构统一多模态理解与生成;
  • JanusFlow(2024 年 11 月,arXiv:2411.07975):自回归语言模型与矫正流(Rectified Flow) 融合,在单一 LLM 框架内端到端训练;
  • DeepSeek-VL2(2024 年 12 月,arXiv:2412.10302):MoE 视觉-语言模型;
  • DeepSeek-R1-Lite(2024 年 11 月):推理模型预览版,明确了 DeepSeek 正在用强化学习做推理能力的路线。

2024 年 12 月:DeepSeek-V3——671B 稀疏模型与一批推理工程创新#

DeepSeek-V3(2024 年 12 月)是让 DeepSeek 出圈的模型:671B 总参数、37B 激活的 MoE,架构仍是 V2 的 DeepSeekMoE + MLA,但围绕”经济性”贡献了一批工程创新。其中与推理直接相关的:

  • MTP(Multi-Token Prediction,多 token 预测):每个位置同时预测未来多个 token,推理时 MTP 模块可以充当草稿模型做自投机解码,加速约 1.8 倍;
  • EPLB(专家并行负载均衡器):推理服务中把高频专家复制到多个 GPU、低频专家按需组合,让专家并行在流量波动下保持均衡;
  • PTX 级通信内核:手写 PTX 指令覆盖 NVLink All-to-All,压缩通信量并完全暴露硬件带宽——DeepSeek”卷内核”传统的开始;
  • FP8 低精度:V3 率先在超大规模 MoE 上验证 FP8 低精度可行性,为后续 FP8 推理部署铺路。

DeepSeek-V3 基本架构:MLA + DeepSeekMoE 主干,右侧为 MTP 多 token 预测模块
DeepSeek-V3 基本架构:MLA + DeepSeekMoE 主干,右侧为 MTP 多 token 预测模块

图:DeepSeek-V3 论文 Figure 2——模型基本架构,包含 DeepSeekMoE 层、MLA 注意力与 MTP 模块(图片来源:DeepSeek-V3 论文

V3 的部署体系是本站多篇文章的主角:块管理(PagedAttention)、迭代级调度(连续批处理)、投机解码(DSpark)共同支撑 V3 在高并发下的低推理成本;每 token 只激活 37B + MLA 的极小 KV 缓存,让单卡就能以不错的吞吐服务。

2025 年 1 月:Janus-Pro 与 DeepSeek-R1——推理模型的引爆点#

  • Janus-Pro(2025 年 1 月,arXiv:2501.17811):视觉编码解耦架构的规模化验证,文生图能力大幅提升。

DeepSeek-R1(2025 年 1 月)是”DeepSeek 时刻”的直接原因:一个纯强化学习训练出的推理模型,长思维链(Long Chain-of-Thought)能力追平 OpenAI o1。训练侧用 GRPO(无监督微调冷启动 + 强化学习),方法细节本文不展开;对推理生态有两个深远影响:

  • 蒸馏(Distillation):把 R1 的推理数据蒸馏进 6 个稠密小模型(1.5B–32B),推理能力可以跨架构迁移到小模型——直接引爆了开源小推理模型的井喷;
  • 低成本推理服务:671B 的 MoE 推理模型跑在低成本硬件上,靠的是对 KV 缓存和调度的极致压榨——正是本站 MLA 拆解DSpark 拆解 覆盖的内容。

2025 年上半年:NSA 论文与 V3-0324——为稀疏注意力铺路#

  • NSA(Native Sparse Attention)(2025 年 2 月,与北大合作):三分支稀疏注意力——压缩分支(历史 KV 块压缩成粗粒度摘要)、选择分支(轻量索引挑出 top-k 重要块做精细注意力)、滑窗分支(保留局部细节),配合专门设计的 Triton kernel 让稀疏注意力在硬件上真正跑赢稠密注意力。它是后续 DSA 的蓝本。本站的 NSA 拆解(一)(二) 已完整覆盖;
  • DeepSeek-V3-0324(2025 年 3 月):V3 推理增强版,未改架构。

2025 年 4 月:DeepSeek-Prover-V2——定理证明推理模型#

DeepSeek-Prover-V2(2025 年 4 月,arXiv:2504.21801):基于 DeepSeek-V3 架构的定理证明推理模型——61 层 Transformer、7168 维隐藏层、163840 最大位置嵌入长度,推理侧采用 FP8 量化优化

2025 年 8 月:V3.1——混合推理与国产硬件适配#

DeepSeek-V3.1(2025 年 8 月)把推理模型和通用模型合并成”一个模型的两种模式”:通过对话模板里的 <think> 标记,同一个权重既能以”思考模式”输出长思维链,也能以”非思考模式”快速回答,由用户控制切换。另外采用 UE8M0 FP8 缩放格式(指数 8 位、尾数 0 位的”纯缩放”格式),为国产芯片生态设计。

2025 年 9–10 月:V3.2-Exp 的 DSA 与 DeepSeek-OCR#

  • DeepSeek-V3.2-Exp(2025 年 9 月):把 NSA 工程化为 DSA(DeepSeek Sparse Attention) 并首次放进产品模型:在几乎不影响输出的前提下,把长文本推理的注意力开销大幅降低——稀疏注意力从论文走向生产的标志性一步。这也是本站 NSA 拆解(二) 最后一节重点分析的落地案例;
  • DeepSeek-OCR(2025 年 10 月):Contexts Optical Compression(上下文光学压缩)——用图像承载文本信息,比用 token 承载便宜得多:约 3.8 亿参数编码器把一页文档压成 100–400 个视觉 token,3B MoE 解码器还原文本,10 倍压缩比下还原精度仍达 97%。表面是 OCR,实质是”用视觉模态做通用上下文压缩”的技术储备。

2025 年 11 月–12 月:DeepSeekMath-V2、V3.2 与 Speciale——验证器与思考型工具调用#

  • DeepSeekMath-V2(2025 年 11 月,arXiv:2511.22570):“生成器-验证器”双模型闭环架构——一个 LLM 担任证明生成器、另一个担任证明验证器,验证器层抑制模型幻觉;
  • DeepSeek-V3.2 正式版(2025 年 12 月,arXiv:2512.02556):DSA 稀疏注意力正式转正进产品;并强化思考型工具调用——模型在思维链中途调用代码执行、数据库查询等工具,根据结果继续思考再调用,全程保留记录,是 Agent 时代对推理模型的核心需求;
  • DeepSeek-V3.2-Speciale:高计算量长思考版,融合 DeepSeek-Math-V2 的定理证明能力,主打极致推理。

2025 年 12 月:mHC——流形约束超连接#

mHC(Manifold-Constrained Hyper-Connections,流形约束超连接,2025 年 12 月,arXiv:2512.24880):把残差连接中的混合矩阵约束在双随机矩阵流形上(行列和为 1,用 Sinkhorn-Knopp 迭代投影),谱范数上界为 1,从数学上保证深层网络的数值稳定——这也是 V4 能堆到 61 层深度的关键支撑。

2026 年 1 月:Engram 与 DeepSeek-OCR 2——记忆与视觉压缩#

  • Engram(2026 年 1 月,arXiv:2601.07372):条件记忆(Conditional Memory) 模块——为长上下文推理提供可检索的外部记忆机制;
  • DeepSeek-OCR 2(2026 年 1 月,arXiv:2601.20552):视觉因果流——OCR 一代”光学上下文压缩”路线的升级。

2026 年 4 月:DeepSeek-V4——1.6T 参数与百万上下文#

DeepSeek-V4(2026 年 4 月)是时间线的当前终点。家族两个模型:

模型总参数每 token 激活上下文
DeepSeek-V4-Pro1.6T49B原生 1M
DeepSeek-V4-Flash284B13B原生 1M

相比 V3.2,V4 与推理直接相关的核心创新:

  1. 混合注意力 CSA + HCA:注意力架构的又一次换代。CSA(压缩稀疏注意力) 把每 4 个 KV token 压成 1 个,用轻量 Lightning Indexer(低秩多查询注意力,FP4 精度)选出 top-1024 个相关压缩块做精细注意力,配滑窗保留局部——稀疏选择逻辑由 DSA 演化融入;HCA(重度压缩注意力) 用更激进的压缩率(128 个 token 压成 1 个)但保持稠密注意力,捕捉全局长程信号。两类层交错排布,把 1M 上下文从”能跑”变成”便宜地跑”:同样 1M 上下文下,V4-Pro 的单 token 推理 FLOPs 只有 V3.2 的 27%、KV 缓存只有 10%;V4-Flash 进一步降至 10% 和 7%;
  2. FP4 量化:MoE 专家权重和索引器 QK 路径按 FP4 精度部署(非专家部分 FP8),显存占用再砍一半;
  3. MTP(多令牌预测)模块:继承自 V3,推理时作为草稿模型做自投机解码;
  4. 异构 KV 缓存:共享前缀落盘复用,长上下文场景的 KV 缓存按热度分层存储;
  5. TileLang 内核:自研 DSL 做硬件可移植 kernel,单个融合 MoE kernel 重叠计算/通信/访存,两阶段上下文并行,专家并行适配昇腾 NPU(1.50–1.73 倍加速验证);
  6. Muon 优化器:基于正交化(Newton-Schulz 迭代)的矩阵优化器,嵌入层与输出头仍用 AdamW——万亿级 MoE 上的首次大规模部署。

V4 发布后的节奏:2026 年 7 月 V4-Flash 公开测试版(原生支持 Responses API);8 月 13 日 V4-Pro 正式版全量上线(low/high/max 三档思考强度);8 月 21 日发布 V4-Flash-Vision-Exp 多模态实验版。截至本文写作(2026 年 8 月 28 日),V4 系列就是 DeepSeek 的最新状态。

2026 年 6 月:DSpark——半自回归投机解码框架#

DSpark(2026 年 6 月,DeepSeek 与北大合作):一个半自回归投机解码框架——并行主干网络一次性产出全部候选位置的隐藏状态,轻量级顺序模块逐 token 注入前缀依赖,配合置信度调度验证机制(逐位置置信度校准 + 硬件感知前缀调度器动态决定验证长度),相比 MTP-1 基线,单用户生成速度提升 60% 至 85%。本站的 DSpark 完全拆解 已完整覆盖。注意:DSpark 论文里的 “MTP-1” 指”单 token 预测基线”(MTP 模块作为草稿模型的自投机基线),与 V3/V4 的 MTP 模块同源同宗——DeepSeek 的推理加速技术从 MTP 一路演进到 DSpark,主线非常连贯。

全景:三条技术主线的演进#

把所有模型并排看,DeepSeek 三年其实只做了三件事,每条主线都极其连贯:

时间模型总参数/激活注意力关键创新(推理侧)
2023-11DeepSeek LLM 67B67B(稠密)MHA起点,开源路线确立
2024-01DeepSeekMoE 16B16B / 2.7BMHA细粒度专家分割 + 共享专家 + 归一化 Sigmoid 门控(激活参数大幅下降)
2024-03DeepSeek-VL1.3B / 7B视觉-语言多模态起点
2024-05DeepSeek-V2236B / 21BMLA低秩 KV 压缩(-93.3%),推理显存/带宽砍到 1/10
2024-09DeepSeek-V2.5MLA通用与代码能力融合
2024-10Janus视觉编码解耦(理解/生成双路径),单一自回归 Transformer
2024-11JanusFlow自回归语言模型 + 矫正流(Rectified Flow)融合
2024-12DeepSeek-VL2MoEMoE 视觉-语言模型
2024-12DeepSeek-V3671B / 37BMLAMTP 自投机(~1.8×)、EPLB 专家负载均衡、PTX 通信内核、FP8
2025-01Janus-Pro视觉编码解耦架构规模化验证
2025-01DeepSeek-R1671B / 37BMLA推理模型(长思维链)、推理数据蒸馏到小模型
2025-02NSA三分支稀疏注意力(压缩/选择/滑窗),Triton kernel
2025-04DeepSeek-Prover-V2基于 V3MLA定理证明推理模型,FP8 量化推理
2025-08DeepSeek-V3.1671B / 37BMLA混合推理(思考/非思考双模式)、UE8M0
2025-09V3.2-Exp671B / 37BDSA稀疏注意力首次进产品,长上下文推理开销大降
2025-10DeepSeek-OCR3B MoE光学上下文压缩(视觉 token 承载文本)
2025-11DeepSeekMath-V2生成器-验证器双模型闭环,抑制幻觉
2025-12V3.2 / Speciale671B / 37BDSA思考型工具调用、Agent 管线
2025-12mHC流形约束超连接(双随机矩阵流形)
2026-01Engram条件记忆(Conditional Memory)模块
2026-01DeepSeek-OCR 2视觉因果流
2026-04DeepSeek-V41.6T / 49BCSA+HCA1M 上下文(27% FLOPs、10% KV)、FP4、MTP、异构 KV 缓存、TileLang、Muon
2026-06DSpark半自回归投机解码(单用户生成速度 +60%~85%)

三条主线:

  1. 注意力从”全量”走向”稀疏”:MHA → MLA(低秩压缩,省 KV 显存)→ DSA(稀疏化,省计算)→ CSA+HCA(双层压缩 + 索引选择,1M 上下文普惠)。每一步都在回答同一个问题:长序列的注意力能不能既省显存又省算力还不掉质量;
  2. MoE 从”能用”走向”极致”:细粒度专家 + 共享专家(激活参数大幅下降)→ EPLB 专家负载均衡 → FP4 量化 + 融合 kernel → 昇腾等国产硬件适配。V4-Pro 的 1.6T 参数、49B 激活,意味着服务一个超大模型只需 49B 的算力和一颗大号的 KV 缓存;
  3. 推理服务与部署不断加厚:MTP 自投机解码、PTX 通信内核、稀疏注意力 kernel、异构 KV 缓存、TileLang 可移植内核——配合行业通用的 PagedAttention、连续批处理等技术,把每 token 的推理成本一路打下来。

一个值得注意的全局规律:DeepSeek 每次把推理成本打下来,都会同步把 API 价格打下来——V2 引发价格战、V3.2-Exp 降价 50%、V4-Flash 把百万 token 输入压到 1 元。开源权重 + 低价 API + 透明技术报告,三者互为因果。

小结#

从 67B 稠密模型到 1.6T 稀疏模型,DeepSeek 的三年演进可以概括为一句话:用极致的工程效率,把稀疏化(MoE + 稀疏注意力)和低精度(FP8/FP4)两条路线推到行业最前沿,让超大模型的推理成本一路走低。它没有发明全新的模型范式,但每一代都把已有的技术组件打磨到成本极限,再靠开源放大了整个行业的影响力。

这张地图上的每块拼图,在文章板块都有(或将有)对应的深度拆解:MLA 已拆(完全拆解)、PagedAttention 已拆(完全拆解)、NSA/DSA 已拆(第一部分第二部分)、DSpark 投机解码已拆(完全拆解)、连续批处理已拆(完全拆解)。后续计划逐步补齐:MTP 投机解码、CSA/HCA 混合注意力、EPLB 专家并行——每篇都会以本文为上下文,讲清”它在这条时间线上的位置”。

参考资料#

  1. DeepSeek LLM(arXiv:2401.02954)
  2. DeepSeekMoE(arXiv:2401.06066)
  3. DeepSeekMath(arXiv:2402.03300,GRPO 出处)
  4. DeepSeek-VL(arXiv:2403.05525)
  5. DeepSeek-V2(arXiv:2405.04434)
  6. Janus(arXiv:2410.13848)
  7. JanusFlow(arXiv:2411.07975)
  8. DeepSeek-VL2(arXiv:2412.10302)
  9. DeepSeek-V3 Technical Report(arXiv:2412.19437)
  10. Janus-Pro(arXiv:2501.17811)
  11. DeepSeek-R1(arXiv:2501.12948)
  12. Native Sparse Attention(arXiv:2502.11089)
  13. DeepSeek-Prover-V2(arXiv:2504.21801)
  14. DeepSeek-V3.1 官方发布说明
  15. DeepSeek-V3.2 正式版与 Speciale 官方发布说明
  16. DeepSeek-OCR(arXiv:2510.18234)
  17. DeepSeekMath-V2(arXiv:2511.22570)
  18. DeepSeek-V3.2(arXiv:2512.02556)
  19. mHC(arXiv:2512.24880)
  20. Engram(arXiv:2601.07372)
  21. DeepSeek-OCR 2(arXiv:2601.20552)
  22. DeepSeek-V4 Technical Report(arXiv:2606.19348)
  23. DSpark(arXiv:2607.05147)
  24. deepseek-ai/DeepSeek-V4-Pro(Hugging Face 模型仓库)
  25. DeepSeek API 官方更新日志
  26. The DeepSeek Series: A Technical Overview(Martin Fowler 博客)

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

DeepSeek 技术全景:从 67B 稠密模型到 1.6T 稀疏模型的三年演进
https://pinghaoyang.com.cn/aigc/posts/deepseek-technologies-timeline/
作者
平昊阳
发布于
2026-08-28
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
平昊阳
乘长风,破巨浪, 展鸿图于未央!
--
总访问量
--
访客数
公告
欢迎来到我的个人博客!欢迎关注交流吖!
更多相关公告,见
社交-留言」。
音乐
封面

音乐

暂未播放

0:000:00
暂无歌词
站点统计
文章
88
分类
18
标签
114
总字数
747,863
运行时长
0
最后活动
0 天前

文章目录