![]()
这项由香港中文大学与腾讯AI实验室联合开展的研究,于2026年7月发表在预印本平台arXiv上,论文编号为arXiv:2607.13399v1。感兴趣的读者可通过该编号查阅完整论文。研究系统地剖析了大型语言模型训练中一种被广泛使用却鲜少被深入理解的方法——"在线策略蒸馏"(On-Policy Distillation,以下简称OPD),从它到底能做什么、什么情况下会出问题、以及怎么修复这三个维度展开了完整的实证研究。
说到底,这项研究想解决的是AI训练领域里一个令人头疼的怪象:明明用了更强大的"老师"AI来教"学生"AI,结果学生却学得更差了;明明训练看起来一切正常,准确率却在悄悄崩塌。这些奇怪的现象困扰着无数从事大模型训练的研究者和工程师,而这篇论文给出了清晰的诊断和切实可行的解药。
一、从"拜师学艺"说起:在线策略蒸馏到底是什么
要理解这项研究,先得搞清楚"在线策略蒸馏"是个什么东西。可以把它理解成一种特殊的拜师学艺方式。
传统的AI训练,有点像老师把自己写满答案的作业本直接发给学生,学生照着抄。这种方法的问题在于