DeepSeek-V3
类型:开源权重语言模型(DeepSeek-AI,2024-12) 架构:混合专家(混合专家)+ 多头潜在注意力(MLA) 总参数:671B 激活参数:37B / token 上下文:128K 训练成本:278.8 万 H800 GPU 小时(约 557.6 万美元)
为什么它常被当成”激活参数”的教科书案例
它是第一个把”总参数 vs 激活参数”讲得极其清楚、又足够大的开源模型:61 层 Transformer,前 3 层是稠密 FFN,后 58 层是 MoE;每个 MoE 层有 1 个共享专家 + 256 个路由专家,每 token 激活 8 个路由专家 + 1 个共享专家。
“Under this configuration, DeepSeek-V3 comprises 671B total parameters, of which 37B are activated for each token.”
在这个配置下,DeepSeek-V3 共有 6710 亿个参数,但处理每一个 token 时只激活其中 370 亿个。这就是「总参数」和「激活参数」两个数字并存的由来。
关键架构细节
| 项 | 值 |
|---|---|
| Transformer 层数 | 61(前 3 层稠密) |
| 隐藏维度 | 7168 |
| 每层专家 | 1 共享 + 256 路由 |
| 每 token 激活 | 8 路由 + 1 共享 = 9 个专家 |
| 负载均衡 | 无辅助损失(per-expert bias,γ = 0.001) |
| 预训练数据 | 14.8T tokens |
| 训练稳定性 | ”did not experience any irrecoverable loss spikes or perform any rollbacks” |
无辅助损失负载均衡(它的原创贡献)
传统 MoE 用辅助损失强迫专家均匀负载,但辅助损失太大会损害性能。DeepSeek-V3 改为给每个专家加一个只影响路由、不影响门控值的偏置项:
“At the end of each step, we will decrease the bias term by γ if its corresponding expert is overloaded, and increase it by γ if its corresponding expert is underloaded.”
参数口径注意
- 官方架构口径 671B;Hugging Face 页面统计的张量数约 685B(计入共享参数、辅助模块等)。两者指同一个模型。
- 后续 V3.1 / V3.2 / V3.2-Speciale 沿用 671B/37B 架构,V3.2 引入了 DeepSeek 稀疏注意力(DSA)。
- 2026-04 的 DeepSeek-V4-Pro 改为 1.6T 总参 / 49B 激活 / 1M 上下文(官方公告口径)。
相关页面
- DeepSeek-V3技术报告 —— 来源摘要
- 激活参数 —— “37B”到底意味着什么
- 混合专家 —— 架构原理