音乐
暂未播放
DeepSeek 技术全景:从 67B 稠密模型到 1.6T 稀疏模型的三年演进
为什么需要一张 DeepSeek 技术地图#
如果只看单一论文,DeepSeek 的每一项技术(MLA、DeepSeekMoE、DSA 稀疏注意力、MTP 投机解码)都值得单独拆解;但把它们放到时间线上看,会呈现出一条异常清晰的递进逻辑:每代模型只做一两件关键架构升级,其余部分尽量复用,用工程效率把推理成本压到极致。从 2023 年 11 月的 67B 稠密模型,到 2026 年 4 月的 1.6T 稀疏模型,三年间 DeepSeek 的技术路线几乎没有摇摆过。
这篇文章是一张”技术地图”:按发布时间顺序,把 DeepSeek 从第一篇论文到今天所有关键技术梳理一遍——每项技术是什么、解决什么问题、大致怎么做的。按用户要求,本文只做全景概括,不展开细节推导;侧重推理侧的加速与优化。每一项技术后续都会在文章板块以单篇深度拆解的形式补齐(文末列出了本站已完成的对应文章)。
2023 年 11 月:DeepSeek LLM 67B 与 DeepSeek Coder——稠密模型的起点#
DeepSeek 的起点相当朴素。2023 年 11 月发布了两个稠密(Dense)Transformer 模型:DeepSeek Coder(代码模型,最大 33B,16K 上下文)与 DeepSeek LLM 67B(通用模型)。它们确立了 DeepSeek 的两个长期习惯:数据集规模按”万亿 token”级别规划,以及全链路技术细节公开。这一时期没有推理侧的特殊设计,是标准的 MHA 稠密模型。
2024 年 1 月:DeepSeekMoE——细粒度专家分割与共享专家#
DeepSeekMoE(2024 年 1 月)是第一次架构转向,回答的是标准 MoE(如 GShard)的老问题:专家”一整块”前馈网络,激活粗、路由分散、专家之间知识冗余。两个核心设计:
- 细粒度专家分割(Fine-Grained Expert Segmentation):把一个大专家切成多个小专家,同样的计算预算下激活更多更小的专家,组合更灵活;
- 共享专家隔离(Shared Expert Isolation):设少量始终激活的共享专家负责通用知识,路由专家专注专业化分工,避免冗余;
- 归一化 Sigmoid 门控:用归一化后的 Sigmoid 输出替代传统 softmax 门控,缓解路由专家间的负载与知识冗余问题。

图:DeepSeekMoE 论文 Figure 2——三种 MoE 层结构的对比(图片来源:DeepSeekMoE 论文)
对推理的意义:总参数可以很大,但每 token 只激活一小部分专家——671B 的模型每 token 只激活 37B,推理算力需求大幅下降。这套”细粒度 + 共享专家”的骨架此后被 V2、V3、V4 一路沿用。
2024 年 2 月:DeepSeekMath——GRPO 的诞生#
DeepSeekMath(2024 年 2 月)表面是数学模型,实际提出了 GRPO(Group Relative Policy Optimization,组相对策略优化)——一种去掉价值模型的强化学习算法,用组内采样的相对表现做优势估计。GRPO 属于训练侧方法,此后所有 DeepSeek 模型沿用;它对推理的间接影响是造就了 R1 这类推理模型(见后文),本文不展开训练细节。
2024 年 3 月:DeepSeek-VL——多模态的起点#
DeepSeek-VL(2024 年 3 月,arXiv:2403.05525):DeepSeek 在多模态上的第一次尝试,视觉-语言(Vision-Language)架构,1.3B/7B 视觉语言模型。这条线后来在 Janus 系列与 DeepSeek-OCR 上开花结果。
2024 年 5 月:DeepSeek-V2——MLA 低秩压缩,把注意力成本打下来#
DeepSeek-V2(2024 年 5 月)是第一个里程碑:DeepSeekMoE 处理”算力”问题,新提出的 MLA(Multi-head Latent Attention,多头潜在注意力) 处理”显存与带宽”问题。
在 MLA 之前,长上下文推理的瓶颈在于 KV Cache:MHA 每个头都存一份完整 K、V,序列越长显存越大,解码阶段每次生成一个 token 都要把整段 KV 读回片上(内存带宽受限)。GQA/MQA 用”多个查询头共享一组 KV 头”压缩,但那是离散压缩——共享组内信息全部丢失。
MLA 的思路是低秩连续压缩:先用低秩矩阵把输入压缩成一份共享潜在向量 ct,再从 ct 上投影出每个头的 K、V。推理时只需缓存低维的 ct 和少量用于 RoPE 的解耦向量,每 token 的 KV 缓存从 MHA 的 2nhdh 降到 dc+dhR(V2 中约 576 维 vs 8192 维),缩减约 93.3%(1024 长度下 KV 缓存从约 5.2GB 降至 765MB,约 15%),比 GQA 高一个数量级且不丢信息。工程上还有”矩阵吸收”技巧:把 WUK、WUV 吸收进查询/输出投影,推理时注意力模块的 FLOPs 反而比标准 MHA 更少。本站的 MLA 完全拆解 有完整推导。

图:DeepSeek-V2 论文 Figure 2——整体架构示意图(图片来源:DeepSeek-V2 论文)

图:DeepSeek-V2 论文 Figure 3——MLA 用低秩潜在向量联合压缩全部 KV 头(图片来源:DeepSeek-V2 论文)
V2 是 236B 总参数(21B 激活)的 MoE,上下文 128K(用 YaRN 扩展)。推理成本打下来的直接结果,是官方 API 价格压到一个数量级以下——“DeepSeek 价格屠夫”称号由此而来,而价格能压下来的根本原因就是 MLA 把推理显存和带宽需求砍到了 1/10 量级。
2024 年 9 月–12 月:V2.5、多模态与 R1-Lite——过渡与预告#
- DeepSeek-V2.5(2024 年 9 月):把 DeepSeek-Coder-V2 与 V2-Chat 合并为通用模型;
- Janus(2024 年 10 月,arXiv:2410.13848):视觉编码解耦——用两条独立的视觉编码路径分别处理”理解”与”生成”任务,单一自回归 Transformer 架构统一多模态理解与生成;
- JanusFlow(2024 年 11 月,arXiv:2411.07975):自回归语言模型与矫正流(Rectified Flow) 融合,在单一 LLM 框架内端到端训练;
- DeepSeek-VL2(2024 年 12 月,arXiv:2412.10302):MoE 视觉-语言模型;
- DeepSeek-R1-Lite(2024 年 11 月):推理模型预览版,明确了 DeepSeek 正在用强化学习做推理能力的路线。
2024 年 12 月:DeepSeek-V3——671B 稀疏模型与一批推理工程创新#
DeepSeek-V3(2024 年 12 月)是让 DeepSeek 出圈的模型:671B 总参数、37B 激活的 MoE,架构仍是 V2 的 DeepSeekMoE + MLA,但围绕”经济性”贡献了一批工程创新。其中与推理直接相关的:
- MTP(Multi-Token Prediction,多 token 预测):每个位置同时预测未来多个 token,推理时 MTP 模块可以充当草稿模型做自投机解码,加速约 1.8 倍;
- EPLB(专家并行负载均衡器):推理服务中把高频专家复制到多个 GPU、低频专家按需组合,让专家并行在流量波动下保持均衡;
- PTX 级通信内核:手写 PTX 指令覆盖 NVLink All-to-All,压缩通信量并完全暴露硬件带宽——DeepSeek”卷内核”传统的开始;
- FP8 低精度:V3 率先在超大规模 MoE 上验证 FP8 低精度可行性,为后续 FP8 推理部署铺路。

图:DeepSeek-V3 论文 Figure 2——模型基本架构,包含 DeepSeekMoE 层、MLA 注意力与 MTP 模块(图片来源:DeepSeek-V3 论文)
V3 的部署体系是本站多篇文章的主角:块管理(PagedAttention)、迭代级调度(连续批处理)、投机解码(DSpark)共同支撑 V3 在高并发下的低推理成本;每 token 只激活 37B + MLA 的极小 KV 缓存,让单卡就能以不错的吞吐服务。
2025 年 1 月:Janus-Pro 与 DeepSeek-R1——推理模型的引爆点#
- Janus-Pro(2025 年 1 月,arXiv:2501.17811):视觉编码解耦架构的规模化验证,文生图能力大幅提升。
DeepSeek-R1(2025 年 1 月)是”DeepSeek 时刻”的直接原因:一个纯强化学习训练出的推理模型,长思维链(Long Chain-of-Thought)能力追平 OpenAI o1。训练侧用 GRPO(无监督微调冷启动 + 强化学习),方法细节本文不展开;对推理生态有两个深远影响:
2025 年上半年:NSA 论文与 V3-0324——为稀疏注意力铺路#
2025 年 4 月:DeepSeek-Prover-V2——定理证明推理模型#
DeepSeek-Prover-V2(2025 年 4 月,arXiv:2504.21801):基于 DeepSeek-V3 架构的定理证明推理模型——61 层 Transformer、7168 维隐藏层、163840 最大位置嵌入长度,推理侧采用 FP8 量化优化。
2025 年 8 月:V3.1——混合推理与国产硬件适配#
DeepSeek-V3.1(2025 年 8 月)把推理模型和通用模型合并成”一个模型的两种模式”:通过对话模板里的 <think> 标记,同一个权重既能以”思考模式”输出长思维链,也能以”非思考模式”快速回答,由用户控制切换。另外采用 UE8M0 FP8 缩放格式(指数 8 位、尾数 0 位的”纯缩放”格式),为国产芯片生态设计。
2025 年 9–10 月:V3.2-Exp 的 DSA 与 DeepSeek-OCR#
- DeepSeek-V3.2-Exp(2025 年 9 月):把 NSA 工程化为 DSA(DeepSeek Sparse Attention) 并首次放进产品模型:在几乎不影响输出的前提下,把长文本推理的注意力开销大幅降低——稀疏注意力从论文走向生产的标志性一步。这也是本站 NSA 拆解(二) 最后一节重点分析的落地案例;
- DeepSeek-OCR(2025 年 10 月):Contexts Optical Compression(上下文光学压缩)——用图像承载文本信息,比用 token 承载便宜得多:约 3.8 亿参数编码器把一页文档压成 100–400 个视觉 token,3B MoE 解码器还原文本,10 倍压缩比下还原精度仍达 97%。表面是 OCR,实质是”用视觉模态做通用上下文压缩”的技术储备。
2025 年 11 月–12 月:DeepSeekMath-V2、V3.2 与 Speciale——验证器与思考型工具调用#
- DeepSeekMath-V2(2025 年 11 月,arXiv:2511.22570):“生成器-验证器”双模型闭环架构——一个 LLM 担任证明生成器、另一个担任证明验证器,验证器层抑制模型幻觉;
- DeepSeek-V3.2 正式版(2025 年 12 月,arXiv:2512.02556):DSA 稀疏注意力正式转正进产品;并强化思考型工具调用——模型在思维链中途调用代码执行、数据库查询等工具,根据结果继续思考再调用,全程保留记录,是 Agent 时代对推理模型的核心需求;
- DeepSeek-V3.2-Speciale:高计算量长思考版,融合 DeepSeek-Math-V2 的定理证明能力,主打极致推理。
2025 年 12 月:mHC——流形约束超连接#
mHC(Manifold-Constrained Hyper-Connections,流形约束超连接,2025 年 12 月,arXiv:2512.24880):把残差连接中的混合矩阵约束在双随机矩阵流形上(行列和为 1,用 Sinkhorn-Knopp 迭代投影),谱范数上界为 1,从数学上保证深层网络的数值稳定——这也是 V4 能堆到 61 层深度的关键支撑。
2026 年 1 月:Engram 与 DeepSeek-OCR 2——记忆与视觉压缩#
- Engram(2026 年 1 月,arXiv:2601.07372):条件记忆(Conditional Memory) 模块——为长上下文推理提供可检索的外部记忆机制;
- DeepSeek-OCR 2(2026 年 1 月,arXiv:2601.20552):视觉因果流——OCR 一代”光学上下文压缩”路线的升级。
2026 年 4 月:DeepSeek-V4——1.6T 参数与百万上下文#
DeepSeek-V4(2026 年 4 月)是时间线的当前终点。家族两个模型:
| 模型 | 总参数 | 每 token 激活 | 上下文 |
|---|---|---|---|
| DeepSeek-V4-Pro | 1.6T | 49B | 原生 1M |
| DeepSeek-V4-Flash | 284B | 13B | 原生 1M |
相比 V3.2,V4 与推理直接相关的核心创新:
- 混合注意力 CSA + HCA:注意力架构的又一次换代。CSA(压缩稀疏注意力) 把每 4 个 KV token 压成 1 个,用轻量 Lightning Indexer(低秩多查询注意力,FP4 精度)选出 top-1024 个相关压缩块做精细注意力,配滑窗保留局部——稀疏选择逻辑由 DSA 演化融入;HCA(重度压缩注意力) 用更激进的压缩率(128 个 token 压成 1 个)但保持稠密注意力,捕捉全局长程信号。两类层交错排布,把 1M 上下文从”能跑”变成”便宜地跑”:同样 1M 上下文下,V4-Pro 的单 token 推理 FLOPs 只有 V3.2 的 27%、KV 缓存只有 10%;V4-Flash 进一步降至 10% 和 7%;
- FP4 量化:MoE 专家权重和索引器 QK 路径按 FP4 精度部署(非专家部分 FP8),显存占用再砍一半;
- MTP(多令牌预测)模块:继承自 V3,推理时作为草稿模型做自投机解码;
- 异构 KV 缓存:共享前缀落盘复用,长上下文场景的 KV 缓存按热度分层存储;
- TileLang 内核:自研 DSL 做硬件可移植 kernel,单个融合 MoE kernel 重叠计算/通信/访存,两阶段上下文并行,专家并行适配昇腾 NPU(1.50–1.73 倍加速验证);
- Muon 优化器:基于正交化(Newton-Schulz 迭代)的矩阵优化器,嵌入层与输出头仍用 AdamW——万亿级 MoE 上的首次大规模部署。
V4 发布后的节奏:2026 年 7 月 V4-Flash 公开测试版(原生支持 Responses API);8 月 13 日 V4-Pro 正式版全量上线(low/high/max 三档思考强度);8 月 21 日发布 V4-Flash-Vision-Exp 多模态实验版。截至本文写作(2026 年 8 月 28 日),V4 系列就是 DeepSeek 的最新状态。
2026 年 6 月:DSpark——半自回归投机解码框架#
DSpark(2026 年 6 月,DeepSeek 与北大合作):一个半自回归投机解码框架——并行主干网络一次性产出全部候选位置的隐藏状态,轻量级顺序模块逐 token 注入前缀依赖,配合置信度调度验证机制(逐位置置信度校准 + 硬件感知前缀调度器动态决定验证长度),相比 MTP-1 基线,单用户生成速度提升 60% 至 85%。本站的 DSpark 完全拆解 已完整覆盖。注意:DSpark 论文里的 “MTP-1” 指”单 token 预测基线”(MTP 模块作为草稿模型的自投机基线),与 V3/V4 的 MTP 模块同源同宗——DeepSeek 的推理加速技术从 MTP 一路演进到 DSpark,主线非常连贯。
全景:三条技术主线的演进#
把所有模型并排看,DeepSeek 三年其实只做了三件事,每条主线都极其连贯:
| 时间 | 模型 | 总参数/激活 | 注意力 | 关键创新(推理侧) |
|---|---|---|---|---|
| 2023-11 | DeepSeek LLM 67B | 67B(稠密) | MHA | 起点,开源路线确立 |
| 2024-01 | DeepSeekMoE 16B | 16B / 2.7B | MHA | 细粒度专家分割 + 共享专家 + 归一化 Sigmoid 门控(激活参数大幅下降) |
| 2024-03 | DeepSeek-VL | 1.3B / 7B | — | 视觉-语言多模态起点 |
| 2024-05 | DeepSeek-V2 | 236B / 21B | MLA | 低秩 KV 压缩(-93.3%),推理显存/带宽砍到 1/10 |
| 2024-09 | DeepSeek-V2.5 | — | MLA | 通用与代码能力融合 |
| 2024-10 | Janus | — | — | 视觉编码解耦(理解/生成双路径),单一自回归 Transformer |
| 2024-11 | JanusFlow | — | — | 自回归语言模型 + 矫正流(Rectified Flow)融合 |
| 2024-12 | DeepSeek-VL2 | MoE | — | MoE 视觉-语言模型 |
| 2024-12 | DeepSeek-V3 | 671B / 37B | MLA | MTP 自投机(~1.8×)、EPLB 专家负载均衡、PTX 通信内核、FP8 |
| 2025-01 | Janus-Pro | — | — | 视觉编码解耦架构规模化验证 |
| 2025-01 | DeepSeek-R1 | 671B / 37B | MLA | 推理模型(长思维链)、推理数据蒸馏到小模型 |
| 2025-02 | NSA | — | — | 三分支稀疏注意力(压缩/选择/滑窗),Triton kernel |
| 2025-04 | DeepSeek-Prover-V2 | 基于 V3 | MLA | 定理证明推理模型,FP8 量化推理 |
| 2025-08 | DeepSeek-V3.1 | 671B / 37B | MLA | 混合推理(思考/非思考双模式)、UE8M0 |
| 2025-09 | V3.2-Exp | 671B / 37B | DSA | 稀疏注意力首次进产品,长上下文推理开销大降 |
| 2025-10 | DeepSeek-OCR | 3B MoE | — | 光学上下文压缩(视觉 token 承载文本) |
| 2025-11 | DeepSeekMath-V2 | — | — | 生成器-验证器双模型闭环,抑制幻觉 |
| 2025-12 | V3.2 / Speciale | 671B / 37B | DSA | 思考型工具调用、Agent 管线 |
| 2025-12 | mHC | — | — | 流形约束超连接(双随机矩阵流形) |
| 2026-01 | Engram | — | — | 条件记忆(Conditional Memory)模块 |
| 2026-01 | DeepSeek-OCR 2 | — | — | 视觉因果流 |
| 2026-04 | DeepSeek-V4 | 1.6T / 49B | CSA+HCA | 1M 上下文(27% FLOPs、10% KV)、FP4、MTP、异构 KV 缓存、TileLang、Muon |
| 2026-06 | DSpark | — | — | 半自回归投机解码(单用户生成速度 +60%~85%) |
三条主线:
- 注意力从”全量”走向”稀疏”:MHA → MLA(低秩压缩,省 KV 显存)→ DSA(稀疏化,省计算)→ CSA+HCA(双层压缩 + 索引选择,1M 上下文普惠)。每一步都在回答同一个问题:长序列的注意力能不能既省显存又省算力还不掉质量;
- MoE 从”能用”走向”极致”:细粒度专家 + 共享专家(激活参数大幅下降)→ EPLB 专家负载均衡 → FP4 量化 + 融合 kernel → 昇腾等国产硬件适配。V4-Pro 的 1.6T 参数、49B 激活,意味着服务一个超大模型只需 49B 的算力和一颗大号的 KV 缓存;
- 推理服务与部署不断加厚:MTP 自投机解码、PTX 通信内核、稀疏注意力 kernel、异构 KV 缓存、TileLang 可移植内核——配合行业通用的 PagedAttention、连续批处理等技术,把每 token 的推理成本一路打下来。
一个值得注意的全局规律:DeepSeek 每次把推理成本打下来,都会同步把 API 价格打下来——V2 引发价格战、V3.2-Exp 降价 50%、V4-Flash 把百万 token 输入压到 1 元。开源权重 + 低价 API + 透明技术报告,三者互为因果。
小结#
从 67B 稠密模型到 1.6T 稀疏模型,DeepSeek 的三年演进可以概括为一句话:用极致的工程效率,把稀疏化(MoE + 稀疏注意力)和低精度(FP8/FP4)两条路线推到行业最前沿,让超大模型的推理成本一路走低。它没有发明全新的模型范式,但每一代都把已有的技术组件打磨到成本极限,再靠开源放大了整个行业的影响力。
这张地图上的每块拼图,在文章板块都有(或将有)对应的深度拆解:MLA 已拆(完全拆解)、PagedAttention 已拆(完全拆解)、NSA/DSA 已拆(第一部分、第二部分)、DSpark 投机解码已拆(完全拆解)、连续批处理已拆(完全拆解)。后续计划逐步补齐:MTP 投机解码、CSA/HCA 混合注意力、EPLB 专家并行——每篇都会以本文为上下文,讲清”它在这条时间线上的位置”。
参考资料#
- DeepSeek LLM(arXiv:2401.02954)
- DeepSeekMoE(arXiv:2401.06066)
- DeepSeekMath(arXiv:2402.03300,GRPO 出处)
- DeepSeek-VL(arXiv:2403.05525)
- DeepSeek-V2(arXiv:2405.04434)
- Janus(arXiv:2410.13848)
- JanusFlow(arXiv:2411.07975)
- DeepSeek-VL2(arXiv:2412.10302)
- DeepSeek-V3 Technical Report(arXiv:2412.19437)
- Janus-Pro(arXiv:2501.17811)
- DeepSeek-R1(arXiv:2501.12948)
- Native Sparse Attention(arXiv:2502.11089)
- DeepSeek-Prover-V2(arXiv:2504.21801)
- DeepSeek-V3.1 官方发布说明
- DeepSeek-V3.2 正式版与 Speciale 官方发布说明
- DeepSeek-OCR(arXiv:2510.18234)
- DeepSeekMath-V2(arXiv:2511.22570)
- DeepSeek-V3.2(arXiv:2512.02556)
- mHC(arXiv:2512.24880)
- Engram(arXiv:2601.07372)
- DeepSeek-OCR 2(arXiv:2601.20552)
- DeepSeek-V4 Technical Report(arXiv:2606.19348)
- DSpark(arXiv:2607.05147)
- deepseek-ai/DeepSeek-V4-Pro(Hugging Face 模型仓库)
- DeepSeek API 官方更新日志
- The DeepSeek Series: A Technical Overview(Martin Fowler 博客)
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!
部分内容可能已过时
评论区
分享你的想法,与大家交流讨论
音乐
暂未播放



