跳到主要内容
AI 能力图谱

混合专家模型

Mixture of Experts · 模型原理

深入模型原理数据更新于 2026 年 9 月 28 日

它是什么

把模型拆成多组专家子网络,每个词只交给其中几组处理,总量大但每次真正参与计算的部分很小。

为什么重要

它解释了为什么有些模型参数总量很大却依然便宜好跑。看不懂这点,很容易把「参数多」直接等同于「一定慢、一定贵」。

打个比方

像一家大医院的专科门诊:医生总数很多,但你每次只挂两三个科室的号,看病效率不受总人数拖累。

举个例子

同一个系列里标明「总参数很大、激活参数较少」的版本,在家用设备上做本地部署往往比同规模的稠密模型更轻松;选型时除了看总参数,也该看每次实际激活了多少。

常见误解

  • 误解:总参数量大,就等于每个问题都要把所有参数算一遍。 事实:这类架构每次只激活少数专家,单次计算量与激活参数相关。

  • 误解:混合专家模型一定比同规模的稠密模型强。 事实:容量更大不等于效果更好,路由机制和训练数据同样决定表现。

  • 误解:这只是厂商的营销说法。 事实:这是一条有公开研究支撑的架构路线,确实被多个模型采用。

  • 误解:结构复杂就意味着本地一定跑不动。 事实:本地体验更取决于激活参数与量化档位,参数总数只是参考之一。

延伸阅读(相关概念)

本页内容更新于 2026 年 9 月 28 日。概念条目会随模型能力变化而修订。