IBM发布ALTK‑Evolve,凭精选记忆将代理推理成本降至ACE的七分之一
•3 阅读•3分钟•前沿
IBMALTK‑EvolveACEDeepSeek-V3.2
•3 阅读•3分钟•前沿

背景与挑战
在企业级 AI 代理应用中,模型需要频繁调用外部 API 完成多步骤任务。传统的 ReAct 代理虽能自行推理,但在复杂场景下常因缺乏经验而出错,导致任务失败或产生冗余调用。如何在不增加模型权重的前提下,让代理复用自身历史轨迹成为关键。
ALTK‑Evolve 方法概述
ALTK‑Evolve 通过两步机制将代理的历史轨迹转化为可检索的“指南”。
- 抽取:从每一次交互中提取策略、恢复、优化等类型的细粒度指令。
- 合并:对相似指令进行聚类、去重,并记录支持次数(即多少独立任务产生该指令)。
- 检索:在推理时,根据任务特征使用余弦相似度或 LLM 引导挑选少量高支持度指南注入上下文。
与 ACE 的对比实验
IBM 在公开的 AppWorld 基准上分别对 DeepSeek‑V3.2 和 gpt‑oss‑120b 两种模型进行测试。关键指标如下:
| 模型 | 方法 | TGC(任务成功率) | SGC(场景成功率) | Tokens/任务 |
|---|---|---|---|---|
| DeepSeek‑V3.2 | ACE | 80.4 | 73.2 | 634 K |
| DeepSeek‑V3.2 | ALTK‑Evolve | 89.3 | 80.4 | 263 K |
| gpt‑oss‑120b | ACE(全剧本) | 54.8 | 35.7 | 777 K |
| gpt‑oss‑120b | ALTK‑Evolve(精选) | 56.0 | 37.5 | 116 K |
在强模型上,ALTK‑Evolve 在保持或提升成功率的同时,将代价压至 ACE 的约 40%;在弱模型上,两者准确率持平,但代价仅为 ACE 的七分之一。
效果与意义
- 成本降低:通过“精选注入”而非全剧本,显著削减上下文长度,直接降低算力费用。
- 可扩展性:指南按支持次数聚合,易于随业务增长自动累积经验,无需人工标注。
- 鲁棒性提升:在高难度任务中,检索到的高质量指南帮助模型快速定位关键步骤,避免信息噪声。
结论与展望
ALTK‑Evolve 证明了代理记忆的“压缩‑检索”范式在实际企业任务中具备更佳的性价比。未来,IBM 计划将该框架开放为 Hugging Face 库,支持更多模型和多语言环境,并探索与大模型微调相结合的混合策略,以进一步提升复杂业务流程的自动化水平。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。