IBM发布ALTK‑Evolve,凭精选记忆将代理推理成本降至ACE的七分之一

3 阅读3分钟前沿
IBM发布ALTK‑Evolve,凭精选记忆将代理推理成本降至ACE的七分之一

背景与挑战

在企业级 AI 代理应用中,模型需要频繁调用外部 API 完成多步骤任务。传统的 ReAct 代理虽能自行推理,但在复杂场景下常因缺乏经验而出错,导致任务失败或产生冗余调用。如何在不增加模型权重的前提下,让代理复用自身历史轨迹成为关键。

ALTK‑Evolve 方法概述

ALTK‑Evolve 通过两步机制将代理的历史轨迹转化为可检索的“指南”。

  • 抽取:从每一次交互中提取策略、恢复、优化等类型的细粒度指令。
  • 合并:对相似指令进行聚类、去重,并记录支持次数(即多少独立任务产生该指令)。
  • 检索:在推理时,根据任务特征使用余弦相似度或 LLM 引导挑选少量高支持度指南注入上下文。

与 ACE 的对比实验

IBM 在公开的 AppWorld 基准上分别对 DeepSeek‑V3.2 和 gpt‑oss‑120b 两种模型进行测试。关键指标如下:

模型方法TGC(任务成功率)SGC(场景成功率)Tokens/任务
DeepSeek‑V3.2ACE80.473.2634 K
DeepSeek‑V3.2ALTK‑Evolve89.380.4263 K
gpt‑oss‑120bACE(全剧本)54.835.7777 K
gpt‑oss‑120bALTK‑Evolve(精选)56.037.5116 K

在强模型上,ALTK‑Evolve 在保持或提升成功率的同时,将代价压至 ACE 的约 40%;在弱模型上,两者准确率持平,但代价仅为 ACE 的七分之一。

效果与意义

  • 成本降低:通过“精选注入”而非全剧本,显著削减上下文长度,直接降低算力费用。
  • 可扩展性:指南按支持次数聚合,易于随业务增长自动累积经验,无需人工标注。
  • 鲁棒性提升:在高难度任务中,检索到的高质量指南帮助模型快速定位关键步骤,避免信息噪声。

结论与展望

ALTK‑Evolve 证明了代理记忆的“压缩‑检索”范式在实际企业任务中具备更佳的性价比。未来,IBM 计划将该框架开放为 Hugging Face 库,支持更多模型和多语言环境,并探索与大模型微调相结合的混合策略,以进一步提升复杂业务流程的自动化水平。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。