它是什么
让大模型当老师,用它的输出训练一个更小的模型,把某一部分能力压进更小的体积里。
为什么重要
学校机房和教研组的电脑往往跑不动最大的模型。蒸馏让某个固定任务在普通硬件上稳定跑起来,是本地部署能落地的一条现实路径。
打个比方
像名师带徒:把老师多年练出的判断方式教给学生,学生未必能赢过老师,但能在某一科上做得又快又稳。
举个例子
把线上积累的答疑记录交给大模型生成规范答案,再用这批答案训练一个几亿参数的小模型,专门回答作业订正类问题;这类专用模型在固定任务上够用,运行成本也低得多。
常见误解
误解:蒸馏出来的模型和大模型一样强。 事实:它通常只在特定任务上接近老师,通用能力和上限都要低一些。
误解:蒸馏需要大量人工标注数据。 事实:多数流程靠大模型自己生成答案加少量人工筛选,标注门槛比从零训练低得多。
误解:有了蒸馏就不用写提示词了。 事实:提示词仍决定日常使用的稳定性,两者是配合关系而不是替代关系。
误解:任何模型都能拿来当老师。 事实:老师本身在某个任务上不可靠时,蒸馏只会把错误一起传下去,样本质量是前提。
延伸阅读(相关概念)
本页内容更新于 2026 年 9 月 29 日。概念条目会随模型能力变化而修订。