Orchard:面向可扩展智能体 AI 的开源框架
摘要
微软开源 Orchard 框架,以可复用环境服务为核心,支撑多种智能体任务的训练与评估,并用小模型取得了接近前沿的效果。
核心要点
- Orchard 的核心是 Orchard Env,一个轻量级 Kubernetes 环境服务,可并行创建、管理数千个隔离组件,支持数据收集、强化学习 rollouts 和评估。
- Orchard-SWE 基于 Mini-SWE-Agent,使用 107,000 条从 MiniMax-M2.5 和 Qwen3.5-397B 蒸馏的智能体交互数据训练。
- Orchard-SWE 在 SWE-bench Verified 上达到 69.7% 的准确率,使用价值模型重排序后提升至 73.0%,仅动用约 30 亿激活参数。
- 训练采用信用分配监督微调(credit-assignment SFT),从失败的尝试中学习有效部分,以及平衡自适应 rollout 策略应对稀疏奖励。
- Orchard 支持在真实部署工具(如 Codex、OpenClaw、ZeroClaw)内直接训练智能体,通过轻量代理记录模型调用,消除训练与部署环境的不匹配。
原文佐证
- Orchard-SWE reaches 69.7% on SWE-bench Verified—73.0% with value-model reranking—using only about 3 billion active parameters, approaching frontier systems using more than 10 times larger models.
- At the center of Orchard is Orchard Env, a lightweight, Kubernetes environment that provides reusable isolated components for running and building agents at scale—from collecting training data to reinforcement learning rollouts and evaluation.
AI 洞察
Orchard 证明了开源环境基础设施可以显著降低智能体研究门槛,小模型通过高效数据利用也能逼近大模型成果,这可能推动智能体 AI 从“拼参数”转向“拼数据质量与环境设计”。环境层与分离架构也预示未来智能体训练将像云计算一样标准化,不同任务和 harness 可共享同一套基础设施,加速行业应用落地。