稠密的尽头:为什么需要稀疏

过去两年,大模型的演进主线一度被概括为"更大的稠密模型"。一个稠密 Transformer 的每一次前向计算,都要让输入 token 穿过全部参数——参数量翻倍,单 token 计算量也几乎翻倍。这意味着模型的"知识容量"与"推理成本"被死死绑在一起:想变聪明,就要付出等比例的算力账单。

这条路的尽头是算力墙。训练算力尚可靠堆卡解决,推理侧的边际成本却无法回避:企业按 token 付费,稠密模型每多一分能力,都要为"每个 token 都激活全部参数"这件事买单。于是稀疏激活(Sparse Activation)走上前台,其代表就是混合专家模型(Mixture of Experts,MoE)。

MoE 的核心思想一句话可以概括:让模型的参数总量与单次推理的计算量解耦。总参数可以很大,但每个 token 只激活其中一小部分"专家"(Expert)。知识装得下,算力花得省——这正是 2025 年以来几乎所有头部厂商旗舰模型的共同选择。

MoE 原理拆解:路由器、专家与负载均衡

标准 Transformer 的前馈网络(FFN)层,在 MoE 中被替换为一组并行的专家网络。每个 token 并不进入所有专家,而是先经过一个路由器(Router,也叫门控网络),由它决定 token 该交给哪几位专家处理。

路由器:本质上是一个线性层加 softmax,对每个专家输出一个得分,再取 top-k 作为该 token 的激活专家。k 通常取 1 或 2:k=1 称为 Switch 路由,计算最省但路由容错低;k=2 是经典设计,两个专家共同处理一个 token,结果加权合并。训练时通常会注入 Gumbel 噪声做随机探索,避免路由过早收敛到局部最优。

专家网络:每个专家是一个独立的 FFN,理论上可以是任意子网络。专家之间天然形成"分工"——公开资料整理显示,训练完成的 MoE 中,专家会自发涌现出领域倾向:有的擅长代码、有的擅长数学、有的擅长长文本,尽管这种分工从未被显式指定过。这正是"混合专家"名字的由来:它模拟的是多个专才各司其职、再由调度者分派的组织方式。

负载均衡:这是 MoE 最容易翻车的地方。如果不加约束,路由器会变成"马太效应"的放大器——少数几个专家得分一直最高,被所有 token 争抢,其余专家几乎饿死。这导致两个恶果:一是计算资源浪费,热门专家成为瓶颈;二是冷门专家因样本太少而训练不足,模型整体能力退化。工程上通常用负载均衡损失(aux loss)把路由分布拉向均匀,并配合容量因子(capacity factor)限制每个专家单批能处理的 token 上限。这里存在一个微妙的取舍:负载越均衡,单个专家的"专精度"越低——过度均衡会让 MoE 退化成"均匀的稠密模型"。如何在"均衡"与"分化"之间找到平衡点,是各家模型厂商的核心工程机密之一。

训练稳定性:稀疏架构的工程修罗场

稀疏不等于简单。MoE 的训练稳定性问题,长期是社区公认的难点。

第一个问题是专家坍缩。路由器的初始权重是随机的,早期训练阶段若某个专家偶然获得较高得分,会形成正反馈:得分高→训练样本多→能力更强→得分更高。若无干预,大量专家在训练早期就"失业"。工程对策包括:aux loss 惩罚路由分布的不均匀度;专家 dropout(以一定概率丢弃得分最高的专家,迫使模型探索次优专家);以及 routing z-loss 稳定路由 logits 的数值尺度。

第二个问题是微批次统计噪声。稠密模型里每个 token 都经过同一组参数,梯度统计天然稳定;MoE 里每个专家只吃到被路由过来的那部分 token,专家粒度上的 batch 可能很小,梯度方差大,训练曲线容易震荡。为此需要更精细的学习率调度、通过 token 重排凑出更大的专家 batch,以及更保守的初始化。

第三个问题是与分布式训练的耦合。MoE 的专家天然适合专家并行(Expert Parallelism):不同专家放在不同 GPU 上,token 按路由结果跨设备搬运,由此引入大量 all-to-all 通信,通信与计算的重叠调度直接决定训练吞吐。可以说,MoE 的工程难度从"模型设计"转移到了"系统设计"——这也是为什么小团队复现稠密模型容易、复现高质量 MoE 很难。

推理部署:显存、通信与专家缓存的博弈

训练只是开始,MoE 的推理部署才是真正考验工程能力的环节,主要矛盾集中在三个层面。

显存:稀疏激活只省计算,不省显存。所有专家权重都必须常驻内存,哪怕一次推理只用到其中一小部分。这意味着 MoE 的显存占用与其总参数量成正比,而非激活量。实践中要么用专家并行把不同专家分布到多卡,要么做专家卸载(把冷门专家换出到 CPU/SSD,按需换入),要么接受单机放不下的事实。Hunyuan A13B 这类命名直接标注"激活 13B"的模型,本质就是在告诉用户:总参数更大,但推理时只激活其中一部分。

通信:token 的 dispatch(分发)与 combine(合并)是两次跨设备 all-to-all 通信。路由越"全局"(token 可以去任意设备上的专家),负载越均衡,但通信量越大;路由越"局部"(限制在本地设备内选专家),通信越省,但负载均衡与专家利用率下降。在普通 PCIe 互联与 NVLink 级高速互联之间,通信开销可以相差一个数量级。这也是 MoE 服务"单机部署难、集群部署贵"的结构性原因。

多专家缓存:推理时 KV Cache 与专家路由交织出新的复杂性——同一个序列的不同 token 可能落在不同专家上,显存管理、预填充(prefill)与逐 token 生成(decode)阶段的路由行为差异,都会影响吞吐。行业实践中常见的优化包括:对路由结果做缓存与预测(复用相似 prompt 的专家选择)、投机解码中用小型稠密模型做 draft、用 MoE 做 verify,以及把 MoE 与量化、KV Cache 压缩等技术叠加。

这些挑战的回报是实打实的:MoE 让"旗舰级能力"和"平民级价格"第一次可以同时成立。

2026 年 MoE 主流模型盘点

据昆仑镜 AI 中心模型库(2026-08 验证),2026 年主流 MoE 路线的代表模型呈现出清晰的性价比分层(价格均为 USD/1M tokens):

  • DeepSeek V4 Pro / Flash:1M 上下文,Pro 输入/输出 $0.435/$0.87,能力分 95/92/93/93(中文/推理/代码/质量);Flash 输入/输出 $0.14/$0.28,中文能力分高达 96。作为稀疏路线的长期代表,其"能力对标旗舰、价格打到零头"的策略,让 MoE 的成本优势成为行业标尺。
  • Qwen3.7 Max / Plus / Flash:三档全部 1M 上下文。Max 输入/输出 $1.48/$4.43,能力分 95/92/91/93;Flash 输入仅 $0.03、输出 $0.13,是当前价格体系里最激进的档位之一,能力分仍有 92/82/86/84。同一家族用同一架构铺开从旗舰到边缘的全价位,正是 MoE 可伸缩性的教科书式应用。
  • GLM 5.2:1.05M 上下文,$0.72/$2.25,能力分 94/92/92/93。在 1M 级上下文窗口中维持了接近第一梯队的性价比,是"长上下文 + MoE"组合的代表。
  • MiniMax M3:1.05M 上下文,$0.3/$1.2,能力分 93/91/92/91,推理与代码两项均上 90,是头部梯队中价格最低档的有力竞争者。
  • Hunyuan A13B:131K 上下文,$0.14/$0.57,能力分 93/84/85/84。命名中的 A(Active)直接标识激活参数量,清晰展示了稀疏激活"总参数大、激活参数小"的范式。

把这几行数据放在一起看,能得出一个反直觉的结论:价格与能力解耦了。能力分 90+ 的模型,输入价格横跨 $0.03(Qwen3.7 Flash)到 $20(Kimi K3);而 MoE 正是实现这种解耦的主要工程手段之一——用总参数装下知识,用稀疏激活控制每一次调用的账单。对企业选型而言,这意味着"旗舰能力"不再是"旗舰价格"的充分条件。

未来:MoE × 推理时计算

MoE 的下一个增长点,是与推理时计算(test-time compute)的合流。2025-2026 年推理模型的爆发,本质是"让模型在推理阶段想得更久、想得更多"——而想得更久意味着更长的思维链与更多的中间 token。这恰好放大了 MoE 的优势:思维链 token 与普通 token 一样只激活部分专家,思考成本的边际增幅被稀疏结构摊薄。

更前沿的方向包括:为推理模型定制"思考专家"与"回答专家"的分工(长思考走深度专家路径,快回答走浅层路径);对 MoE 专家做持续的增量训练(新数据只更新相关专家,降低全量微调成本);以及多模态 MoE——视觉、语音、文本各配专家,路由器跨模态调度。这些方向的共同逻辑是一致的:MoE 把"模型规模"从静态资源变成了可编排的运行时资源

结语

从稠密到稀疏,MoE 完成了一次架构层面的范式转移:模型不再以"每个 token 都要过全部参数"为代价换取知识容量,而是把知识分布到可调度的专家集群中。它的代价是训练更脆弱、部署更复杂;它的回报是让 90 分以上的能力以几分钱的价格进入生产环境。2026 年的模型价格战背后,站着的是 MoE 这套系统工程。

对企业而言,理解 MoE 不只是理解一种架构,更是理解成本结构的底层逻辑:在稀疏激活时代,"贵的模型"与"好的模型"正在变成两个独立变量。选型时对照真实的能力分与价格数据做决策,比追逐参数与跑分更有意义——昆仑镜(aigc.fushtn.com)作为 AI 数字员工办公平台,其 AI 中心提供全球模型的性价比数据,可作为这类决策的参考锚点。