自定义Amazon Nova Forge多轮强化学习的奖励函数
摘要
AWS官方博客详解如何为Amazon Nova Forge的多轮强化学习设计自定义奖励函数,包括BYOO架构与GRPO优化细节。
核心要点
- 多轮RL中奖励函数由开发者用代码编写,可以是规则校验或LLM-as-Judge,Nova Forge使用GRPO算法,按K个rollout排序并用归一化奖励(advantage)更新模型。
- 多轮任务因Lambda函数15分钟限制而需启用BYOO:设置rollout.delegate为true,在ECS等环境容器中运行用户模拟器、代码执行和验证器,返回aggregate_reward_score及可选metrics_list。
- Nova Forge的serverless多轮RL选项现已普遍可用(GA),适合不愿管理环境的团队。
- 奖励信号仅通过组内变异影响学习:若某项对组内所有完成值相同,则对advantage和梯度无贡献,可能造成训练曲线健康但模型学错。
- 文章引用Chu et al.(2025)研究:相同算力后训练下,RL相比SFT改善OOD泛化,而SFT表现退化。
原文佐证
- A reward signal influences learning only through the variation it creates within a group .
- If a term takes the same value for every completion in a group, it contributes nothing to the advantage.
- Nova Forge also offers a serverless multi-turn RL option, now generally available
AI 洞察
云厂商正在将RL训练能力下沉为开发者级工具,多轮智能体优化成为可自助定制的商品能力。奖励函数是训练意图的关键载体,其设计方法将直接影响Agent行为质量,未来竞争点在于简化奖励设计并增强可解释性。