它是什么
把模型拆成多组专家子网络,每个词只交给其中几组处理,总量大但每次真正参与计算的部分很小。
为什么重要
它解释了为什么有些模型参数总量很大却依然便宜好跑。看不懂这点,很容易把「参数多」直接等同于「一定慢、一定贵」。
打个比方
像一家大医院的专科门诊:医生总数很多,但你每次只挂两三个科室的号,看病效率不受总人数拖累。
举个例子
同一个系列里标明「总参数很大、激活参数较少」的版本,在家用设备上做本地部署往往比同规模的稠密模型更轻松;选型时除了看总参数,也该看每次实际激活了多少。
常见误解
误解:总参数量大,就等于每个问题都要把所有参数算一遍。 事实:这类架构每次只激活少数专家,单次计算量与激活参数相关。
误解:混合专家模型一定比同规模的稠密模型强。 事实:容量更大不等于效果更好,路由机制和训练数据同样决定表现。
误解:这只是厂商的营销说法。 事实:这是一条有公开研究支撑的架构路线,确实被多个模型采用。
误解:结构复杂就意味着本地一定跑不动。 事实:本地体验更取决于激活参数与量化档位,参数总数只是参考之一。
延伸阅读(相关概念)
本页内容更新于 2026 年 9 月 28 日。概念条目会随模型能力变化而修订。