原文 | The Architecture Behind Open-Source LLMs
编译 | 段小草+Gemini 2.5 Pro
2024 年 12 月,DeepSeek 发布了 V3,并声称他们以 557.6 万美元的成本训练出了一个前沿级别的模型。他们使用了一种名为多头潜在注意力的注意力机制,该机制大幅降低了内存使用量。一种专家路由策略避免了通常的性能损失。激进的 FP8 训练进一步削减了成本。
几个月后,月之暗面的 Kimi K2 团队公开采用 DeepSeek 的架构作为其起点,将其扩展到万亿参数规模,发明了一种新的优化器以解决在该规模下出现的训练稳定性挑战,并用它在各大基准测试中展开竞争。
随后,在 2026 年 2 月,智谱 AI 的 GLM-5 将 DeepSeek 的稀疏注意力机制集成到自己的设计中,同时贡献了一个新颖的强化学习框架。
这就是开放权重生态系统的实际运作方式:各个团队在公开环境中基于彼此的创新进行构建,进步的速度因此得以复合式增长。要理解其中缘由,你需要审视其架构。
在本文中,我们将探讨各种开源模型以及定义每个模型的工程决策。
通用骨架
2025 年和 2026 年发布的每一款前沿领域的重量级开放权重 LLM (大语言模型) 都使用了专家混合 (MoE) Transformer 架构。
下图展示了 MoE 架构的概念:

原因在于,密集型 Transformer 会为每个 Token 激活所有参数。要让一个更密集的模型变得更智能,如果你增加更多参数,计算成本就会线性扩展。当参数达到数千亿时,这种做法的成本高得令人望而却步。
MoE 通过将每个 Transformer 模块中单一的前馈层替换为多个更小的“专家”网络和一个学习到的路由器来解决这个问题,路由器决定由哪些专家处理每个 Token。其结果是,一个模型可以例如存储 6710 亿参数的知识,但每个 Token 只需计算 370 亿参数。
这就是为什么每个模型都有两个重要数字:
总参数量 (内存占用,知识容量)
激活参数量 (推理速度,单位 Token 成本)。
想象一家专科医院,有 384 名医生在职,但对于任何一位病人,诊室里只有 8 名医生。你既能受益于 384 位专家的知识,又只需一次性支付 8 位的费用。分诊护士 (即路由器) 决定调用哪几位医生。
这也是为什么一个万亿参数模型和一个 2350 亿参数模型每次查询的成本大致相同的原因。例如,Kimi K2 每个 Token 激活 320 亿参数,而 Qwen3 激活 220 亿参数。换句话说,你比较的是激活参数量,而不是总参数量。
开放权重的现实
几乎所有以“开源”名义推广的模型,在技术上都是开放权重 (open weight) 的。这意味着其训练好的参数是公开的,但训练数据以及通常完整的训练代码并非如此。然而,在传统软件中,“开源”意味着代码是可用、可修改和可再分发的。
这在实践中意味着什么?
你可以下载、微调并商业化部署所有这六个模型。然而,你无法查看或审计它们的训练数据,也无法从头开始复现它们的训练过程。对大多数工程团队而言,重要的只是前者。但了解这一区别很有必要。
许可协议的状况也各不相同。DeepSeek V3 和 GLM-5 使用 MIT 许可证。Qwen3 和 Mistral Large 3 使用 Apache 2.0 许可证。两者都完全允许商业用途。Kimi K2 使用一个修改版的 MIT 许可证。Llama 4 使用一个自定义的社区许可证,该许可证限制月活用户超过 7 亿的公司使用,并禁止使用该模型来训练竞争模型。
透明度也各不相同。一些团队会发布详细的技术报告,包含架构图、消融研究和超参数。另一些团队则只提供权重和一个架构细节较少的博客文章。更高的透明度促成了上文描述的“借鉴与构建”动态,这也是其能奏效的部分原因。
注意力机制的抉择
模型每生成一个 Token,都需要“记住”对话中所有先前 Token 的键 (key) 和值 (value)。这种被称为 KV-cache 的存储空间会随着序列长度线性增长,成为长上下文场景下的内存瓶颈。不同模型采用三种不同策略来应对。
分组查询注意力 (Grouped-Query Attention, GQA) 在多组查询头之间共享键值对。这是行业默认标准,实现简单,并能提供中等程度的内存节省。Qwen3 和 Llama 4 都使用了 GQA。
多头潜在注意力 (Multi-Head Latent Attention, MLA) 在缓存前将键值对压缩到一个低维潜在空间,需要时再解压。该技术在 DeepSeek V2 中被引入,并被 DeepSeek V3 和 Kimi K2 所使用。MLA 比 GQA 节省更多内存,但增加了压缩/解压步骤的计算开销。
稀疏注意力 (Sparse Attention) 会跳过对所有先前 Token 的注意力计算,而是选择最相关的部分。DeepSeek 在 V3.2 中引入了 DeepSeek 稀疏注意力 (DeepSeek Sparse Attention, DSA),而 GLM-5 在其架构中公开采用了 DSA。由于稀疏注意力优化的是注意力层,而 MoE 优化的是前馈层,这两种技术的效果可以叠加。因此,GLM-5 同时受益于两者。
下图展示了 DeepSeek 的 Multi-Head Latent Attention 方法:
来源: DeepSeek Technical Architecture
权衡取舍最终取决于你在部署中最看重什么。GQA 更简单且经过验证。MLA 内存效率更高,但工程实现更复杂。稀疏注意力减少了长上下文的计算量,但需要精心设计以避免遗漏重要 Token。模型选择哪种策略取决于其瓶颈是内存、计算还是上下文长度。
稀疏性的抉择
这六个模型的专家数量从 16 到 384 不等,反映了关于稀疏性应推到何种程度的根本分歧。
在固定的计算预算下,增加专家数量可以改善训练和验证损失。然而,报告也指出,这种增益伴随着基础设施复杂度的增加。更多的总专家数意味着需要将更多的总参数存储在内存中,而 Kimi K2 的万亿参数无论每个 Token 激活多少专家,都需要一个多 GPU 集群。相比之下,Llama 4 Scout 的 1090 亿总参数可以部署在单台高内存服务器上。
另外两个设计选择也值得注意:
首先是共享专家问题。DeepSeek V3、Llama 4 和 Kimi K2 都包含一个处理每个 Token 的共享专家,以提供一个基础能力下限。Qwen3 的技术报告指出,与他们早期的 Qwen2.5-MoE 不同,他们放弃了共享专家,但未披露原因。业界对于共享专家是否值得其计算成本尚无共识。
其次,Llama 4 采用了一种独特的方法。Llama 4 并未将每一层都设为 MoE,而是在密集层和 MoE 层之间交替,并且每个 Token 只路由到 1 个专家 (外加共享专家),而不是 8 个。这意味着每个 Token 激活的专家更少,但每个专家更大。
下图展示了 Llama 的方法:

训练策略的抉择
架构决定了模型的容量,但训练决定了模型实际如何利用这种容量。
预训练 (Pre-training) 阶段,模型通过在数万亿 Token 上预测下一个 Token 来学习,从而获得其基础知识。其规模各不相同 (DeepSeek V3 为 14.8 万亿 Token,Qwen3 高达 36 万亿 Token),但方法类似。后训练 (Post-training) 阶段是模型差异化的开始,如今已成为主要的区分点。
带有可验证奖励的强化学习会检查模型的输出是否客观正确。

代码是否编译通过?数学答案是否正确?模型会因正确的输出而获得奖励,因错误的输出而受到惩罚。这是 DeepSeek R1 背后的突破,其部分要素被提炼并融入了 DeepSeek V3。
从更大的教师模型进行蒸馏是指训练一个巨型模型,并用其输出来教导较小的模型。Llama 4 在预训练阶段就从一个 2 万亿参数的教师模型 Behemoth 进行了协同蒸馏。Qwen3 则从其旗舰模型蒸馏到家族中更小的模型。
下图展示了 Qwen 的后训练流程:

来源:Qwen3 Technical Report
合成智能体数据涉及构建加载了真实工具 (如 API、shell 和数据库) 的模拟环境,然后奖励模型在这些环境中完成任务。例如,Kimi K2 的技术报告描述了一个大规模的流水线,它能在模拟和现实世界环境中系统地生成工具使用范例。
新颖的强化学习基础设施本身也可算作一项贡献。GLM-5 开发了 “Slime”,这是一个新的异步强化学习框架,它提高了后训练的训练吞吐量,从而能在相同的计算预算内进行更多次迭代。
训练的稳定性在这里也值得关注。在这种规模下,一次训练崩溃就可能浪费数天的 GPU 时间。为了应对这个问题,Kimi K2 开发了 MuonClip 优化器,专门用于防止注意力 logits 爆炸,使他们能够在 15.5 万亿 Token 的训练中没有出现一次损失尖峰 (loss spike)。DeepSeek V3 同样报告称,在整个训练过程中没有出现不可恢复的损失尖峰。这些工程贡献可能比任何特定的架构选择更具可复用性。
结论
模型架构正在趋同。大家都在构建 MoE Transformer。训练方法正在分化,各个团队在强化学习、蒸馏、合成数据和新优化器上押下不同的赌注。
本文所涵盖的具体模型将在数月内被超越。然而,评估它们的框架可能不会改变。
关键问题仍然会是关于激活参数量,而不仅仅是总参数量。此外,他们做了什么样的注意力机制权衡,这是否与上下文长度的需求相匹配?每个 Token 激活多少个专家,基础设施能否处理总参数量?它是如何进行后训练的,这种方法是否与你的用例相符?许可证到底允许什么?
京海策略提示:文章来自网络,不代表本站观点。