Signal YCurated AI News
更新于 8/20 09:5261 个信源

从预训练到后训练:理解推理能力的形成

AI 研究7/17 04:00HuggingFace Daily Papers查看原文 ↗
摘要

该研究通过国际象棋受控实验,揭示了预训练数据量和模型大小对RL后训练效果的预测关系,并阐明了RL如何改变模型推理策略。

核心要点
  • 后RL性能在给定RL计算量下可由预训练损失良好预测。
  • RL奖励曲线的斜率随预训练token数近似线性提升。
  • RL并非简单锐化SFT策略:在简单谜题上放大SFT已偏好的正确动作,在困难谜题上挖掘SFT中几乎不存在的正确动作。
  • 模型参数从5M到1B,预训练数据为人类国际象棋对局。
  • 研究还训练了1B参数模型在数学领域文本上,以检验结论的迁移性。
AI 洞察
该研究为理解LLM训练中预训练与后训练的交互提供了可量化的框架,意味着未来可以通过预训练损失来预测后训练收益,从而优化计算资源分配。此外,RL在困难任务上挖掘新策略的能力暗示了后训练可能成为突破预训练瓶颈的关键。