机器学习 | 在线自蒸馏 (OPSD)
在线自蒸馏 (On-Policy Self-Distillation, OPSD):一种让同一大语言模型分别充当教师与学生,教师利用标准答案等特权信息,在学生自身生成轨迹上提供逐词分布监督的推理能力训练方法。
在线自蒸馏 (On-Policy Self-Distillation, OPSD):一种让同一大语言模型分别充当教师与学生,教师利用标准答案等特权信息,在学生自身生成轨迹上提供逐词分布监督的推理能力训练方法。
广义知识蒸馏 (Generalized Knowledge Distillation, GKD):是一种让学生模型在自己生成的 On-Policy 序列上,利用教师模型给出的 Token-Level 分布反馈进行蒸馏,从而缓解自回归模型训练与推理分布不一致问题的方法。
本部分文章将涉及以下 LLM 并行方法:
本部分文章将涉及以下 LLM 并行方法:
视觉语言模型 (Vision Language Model, VLM):能够同时理解文本和图像的多模态大语言模型,输入为图像和文本,输出为文本。
混合专家模型 (Mixture of Experts, MoE):一种通过将多个“专家”子模型组合起来,通过路由模块动态选择部分专家处理不同输入,从而实现高效扩展参数规模、提升性能并降低计算成本的深度学习方法。