苹果牛津发现「蒸馏Scaling Law」!必须满足两个条件,蒸馏才有优势 下午4时 2025/02/14 作者 新智元 系列实验,深入剖析了蒸馏与监督学习的优劣,以及模型表现与计算资源的关系,探索模型优化的新路径。 众所
苹果也在蒸馏大模型,给出了蒸馏Scaling Laws 下午12时 2025/02/14 作者 机器之心 苹果研究人员提出蒸馏扩展定律,基于计算预算及其在学生和教师之间的分配,能够预测蒸馏模型的性能。该发现降低了大规模使用蒸馏的风险,并指导了优化教师和学生模型的计算资源以最大化学生模型性能的方法。