考虑ACE?我们能以更少Token完成同样的事
摘要
IBM研究对比ACE与ALTK-Evolve两种agent记忆系统,显示通过按需检索少量guidelines而非全量注入playbook,ALTK-Evolve能以显著更少的token实现相当或更优的性能。
核心要点
- 在AppWorld上,DeepSeek-V3.2模型下,ALTK-Evolve的TGC/SGC为89.3/80.4,优于ACE的80.4/73.2,token/task从634K降至263K。
- 在gpt-oss-120b模型下,ALTK-Evolve的TGC/SGC为56.0/37.5 vs ACE的54.8/35.7,token/task从777K降至116K(约ACE的1/7)。
- 两种系统都拒绝压缩agent经验:ACE用每个bullet上的helpful/harmful计数器,ALTK-Evolve用support count记录产生该guideline的独立episode数量。
- 关键差异在传递:ACE每步注入完整playbook,ALTK-Evolve按任务检索少量guidelines,将传递看作可调节的dial。
- 按难度分解显示,gpt-oss-120b上ACE在Easy/Medium领先,但ALTK-Evolve在Hard任务上胜出;DeepSeek-V3.2上ALTK-Evolve在Easy、Hard和Overall均占优。
原文佐证
- The difference is what they do with what they learn — and that decides the token bill.
AI 洞察
这显示agent记忆正在从'全量保留并注入'转向'按需检索',与RAG的思路类似,可能重塑agent运行的经济性。未来agent系统的竞争不仅看能力,也看推理成本,高效记忆传递或成为规模化落地的关键。对于行业,这类方法可能让轻量模型获得更强agent能力,降低对超大上下文窗口的依赖。