它的核心逻辑非常朴素:让一个已经训练好的、精度极高的大模型(教师模型),把自己学到的知识、逻辑、推理模式,一点点提炼并传递给一个更小、更轻、更快的小模型(学生模型)。老教师把一生的经验浓缩提炼给学生,学生不用再从头苦读海量书籍,却能快速掌握核心能力。最终,学生体型小、反应快、成本低,却能保留大模型90%以上的能力。
核心逻辑:老师怎么教,学生怎么学
要真正理解蒸馏,关键在于明白大模型是如何“教”的。传统模型训练就像是“刷题背答案”,给模型海量数据,让它记住标准答案(硬标签)。这种方式很死板,模型只记住了结果,不懂底层逻辑。
而模型蒸馏的核心突破,是让小模型学习“软标签”。大模型在预测时,不只是给出一个最终答案,还会输出概率分布。比如判断一张图是不是猫,大模型不会只说“是”,还会给出:猫80%、狗15%、老虎3%、其他2%。这些细微的概率,藏着大模型学到的语言规律、逻辑关系和知识关联。比如,大模型知道猫和狗都有毛茸茸的特征,所以有15%的相似度。
学生模型不去看原始的海量数据,而是直接模仿大模型的判断方式、推理倾向和置信度分布。它学到的不是冰冷的数据,而是大模型提炼过的高阶“思维方式”和“暗知识”。
2026-07-28 09:57:08
2026-07-28 10:26:21
2026-07-28 10:08:51
2026-07-27 11:57:51
2026-07-27 11:37:13
2026-07-27 10:30:22
2026-07-27 11:15:15
2026-07-27 11:06:38
2026-07-24 12:03:13
2026-07-24 11:01:54
2026-07-24 10:39:29
2026-07-24 10:18:45
2026-07-24 10:06:35
2026-07-23 14:00:15
2026-07-23 13:31:10
2026-07-23 14:12:23
2026-07-23 11:50:52
2026-07-23 11:25:00
2026-07-22 11:33:01
2026-07-22 11:01:52
2026-07-22 10:44:21
2026-07-22 10:16:38
2026-07-22 10:04:22
2026-07-21 14:03:04
2026-07-21 13:50:37