探索使用 Amazon Nova 进行监督微调的自蒸馏推理
摘要
AWS 提出自蒸馏推理方法,通过教师模型生成推理轨迹并蒸馏到学生模型,解决监督微调中推理抑制问题,并在三个基准上验证有效性。
核心要点
- 推理抑制问题指在 SFT 中若训练数据缺乏推理轨迹,模型可能丧失推理能力。
- SDR 利用教师模型(如 Amazon Nova)为无推理轨迹的数据集生成思考令牌。
- 方法包括:教师模型生成推理轨迹,学生模型在原始数据和推理轨迹上联合训练。
- 在三个基准(如数学推理、常识推理)上,SDR 相比标准 SFT 提升准确率约 5-10%。
- 实践建议包括选择合适的教师模型、控制蒸馏温度等超参数。
AI 洞察
该方法降低了构建高质量推理数据集的门槛,使更多开发者能定制具备推理能力的模型。未来可能推动 SFT 流程中推理轨迹的标准化生成,加速模型在复杂任务上的应用。