跳到主要内容
AI 能力图谱

模型蒸馏

Distillation · 模型原理

深入模型原理数据更新于 2026 年 9 月 29 日

它是什么

让大模型当老师,用它的输出训练一个更小的模型,把某一部分能力压进更小的体积里。

为什么重要

学校机房和教研组的电脑往往跑不动最大的模型。蒸馏让某个固定任务在普通硬件上稳定跑起来,是本地部署能落地的一条现实路径。

打个比方

像名师带徒:把老师多年练出的判断方式教给学生,学生未必能赢过老师,但能在某一科上做得又快又稳。

举个例子

把线上积累的答疑记录交给大模型生成规范答案,再用这批答案训练一个几亿参数的小模型,专门回答作业订正类问题;这类专用模型在固定任务上够用,运行成本也低得多。

常见误解

  • 误解:蒸馏出来的模型和大模型一样强。 事实:它通常只在特定任务上接近老师,通用能力和上限都要低一些。

  • 误解:蒸馏需要大量人工标注数据。 事实:多数流程靠大模型自己生成答案加少量人工筛选,标注门槛比从零训练低得多。

  • 误解:有了蒸馏就不用写提示词了。 事实:提示词仍决定日常使用的稳定性,两者是配合关系而不是替代关系。

  • 误解:任何模型都能拿来当老师。 事实:老师本身在某个任务上不可靠时,蒸馏只会把错误一起传下去,样本质量是前提。

延伸阅读(相关概念)

本页内容更新于 2026 年 9 月 29 日。概念条目会随模型能力变化而修订。