你的智能体究竟需要多少记忆?

上一篇文章比较了 ALTK-Evolve 与 ACE,说明智能体如何接收自己提炼的指南——为每项任务检索少量内容,或注入整套指南——会同时影响准确率和成本。本文退一步,讨论更先决的问题:究竟应该给它多少?

为智能体配置记忆听起来很简单:从过去的工作中提炼经验,再放回上下文;经验越多,表现应该越好。但实际并非总是如此。当我们把评估扩展到八个模型,从30B稠密模型到前沿专有系统,一项发现格外突出:智能体记忆并非可以简单开启的功能,其剂量需要按模型校准。

核心要点:

  • ALTK-Evolve 让智能体从过去的轨迹中学习,提炼可复用指南,并在推理时重新注入;无需更新权重,也无需人工标注。
  • 不同层级模型所需剂量不同:仍有提升空间的强模型适合整套指南;较弱模型适合精简核心加按任务检索;已趋于饱和的模型没有可测提升。
  • 精选检索可以同时最准确、最便宜:gpt-oss-120b 的任务完成率提高16.1个百分点,token 仅增加5%;提示缓存还能降低生产环境中完整指南的使用成本。

关键发现:剂量取决于能力

我们在覆盖不同能力水平的八个模型中,看到了三种反复出现的模式。

仍有提升空间的强模型需要整套指南。 它们有能力吸收和应用全部指南,包括不常见边界情况的经验。DeepSeek-V3.2(671B MoE)接收完整的自我提炼指南后,任务完成率提高9.5个百分点。

较小或较弱模型会被大量指南淹没。 对这些模型,精简、可信度高的核心,加上每项任务检索的少量相关指南,效果最佳。gpt-oss-120b(117B MoE)通过这种选择性方法提高16.1个百分点;完整指南的收益反而较少,token 成本约高50%。

已趋于饱和的模型没有可测收益。 我们称其为“饱和模式”;这个标签描述观察结果,并非证明了原因。模型可能已接近这些任务的能力上限,指南可能未覆盖剩余失败,或者模型未能有效运用指导。GLM-5(745B MoE)在本次运行中属于这一模式。

决定模式的并不只是参数量。基准上的剩余提升空间、上下文窗口、架构、指南质量和任务分布,都可能影响归属;分离这些因素仍在研究中。实践结论依然成立:记忆的适当剂量取决于模型,而且可以校准。

学习发生在模型周围,而非模型内部

这里的“记忆”不是重放过去的对话,而是一套从智能体自身既往轨迹提炼的指南:有效策略、应避免的错误、边界情况。流程如下:

  1. 智能体尝试任务,产生轨迹。
  2. ALTK-Evolve 从成功和失败的运行中抽取行为指南。
  3. 将指南整合为可复用集合。
  4. 推理时,向智能体提供完整指南,或其中与任务有关的部分。

整个过程不更新模型权重。学习循环改变的是智能体可获得的指导,而不是底层模型。因此,它部署成本低,并能迁移到本次测试的八个模型。

跨能力范围的结果

我们在 AppWorld 上评估了585项多步骤任务:168项 test_normal、417项 test_challenge,覆盖日历、消息、支付等9个模拟应用。评分有两种:是否完整完成每项任务(TGC,任务目标完成率),以及某场景的每个变体是否全部通过(SGC,场景目标完成率,更严格、全有或全无)。完整定义见附录。

比较的三种配置

记忆研究容易混淆实际进入上下文窗口的内容,因此先明确配置。

两种记忆配置都使用同一套指南。指南通过前述循环,只从 AppWorld 的训练集提炼一次。二者仅改变交付方式:完整指南在每一步注入全部内容;精选检索提供选定子集。它们不改变指南产生方式,也从不使用测试集数据构建指南。

配置 智能体上下文中的内容
基线 没有记忆,模型原本的智能体
完整指南集 每个 ReAct 步骤注入全部提炼指南
精选检索 同一套指南中固定的高可信核心,加上为各任务检索的少量相关指南;即固定部分加可变部分

各模型能够提炼的指南数量取决于自身能力,因此我们按策略报告配置,而不按无法跨模型比较的原始指南数量报告。

三种模式一览

下表选取八模型评估中的代表模型,以 test_normal 上的任务完成率为指标。原文图1显示基线与最佳记忆配置的 TGC,其横轴从40%开始以凸显差异。单看 TGC 会低估更大的 SGC 收益。

模型 模式 基线 TGC / SGC(%) 最佳记忆 TGC / SGC(%) 最佳配置 TGC 变化(百分点) SGC 变化(百分点)
gpt-oss-120b(117B MoE) 较弱/选择性 39.9 / 21.4 56.0 / 37.5 精选检索 +16.1 +16.1
DeepSeek-V3.2(671B MoE) 强/仍有提升空间 79.8 / 64.3 89.3 / 80.4 完整指南集 +9.5 +16.1
Claude Opus 4.6 强/仍有提升空间 90.5 / 87.5 94.6 / 94.6 完整指南集 +4.1 +7.1
GPT-5.5 强/接近上限 92.3 / 82.1 95.2 / 89.3 完整指南集 +2.9 +7.2
GLM-5(745B MoE) 饱和 87.5 / 80.4 87.5 / 80.4 完整指南集 0.0 0.0

更严格的 SGC 通常比 TGC 提升更大。例如 DeepSeek 的 SGC 增加16.1个百分点,而 TGC 增加9.5个百分点。这是因为好的指南尤其有助于智能体通过场景的每个变体,而不只是平均情况。

这种效果在能力范围顶端也没有消失:GPT-5.5 和 Opus 的 TGC 已接近上限,但 SGC 仍分别增加7.2和7.1个百分点。只要模型仍有可以针对的失败模式,记忆就可能继续带来收益。

最便宜的记忆策略也可能最好

一个实际问题是:完整指南会膨胀每个 ReAct 步骤的输入,因为每一轮都会重新发送。我们的观察如下:

模型 配置 基线 token/任务 加记忆后 token/任务 增幅
DeepSeek-V3.2 完整指南集 148K 263K +78%
gpt-oss-120b 完整指南集 110K 166K +51%
gpt-oss-120b 精选检索 110K 116K +5%

这些数值是每项任务在智能体各步骤累计的平均 token 使用量,相对于无记忆基线测量。

两个结论:

  1. 精选检索使成本接近基线。 对选择性记忆在准确率上占优的较弱模型,它也在成本上占优。gpt-oss-120b 的 TGC 提升16.1个百分点,而 token 仅增加5%。这里更好的表现并不要求更高的推理成本。
  2. 记忆没有显著延长推理循环。 DeepSeek 有无记忆的平均 ReAct 步数都约为18–19步。成本增加来自输入 token 膨胀,而不是更长的轨迹。

生产环境中真正能提高效率的是提示缓存。指南中的静态部分在步骤之间完全相同,可以缓存,大幅降低实际成本。值得设计能利用缓存的提示结构:保持共享指南前缀稳定,使其持续可缓存。

我们也假设上下文窗口大小有影响:窗口较大的模型可能更有效吸收完整指南,较小窗口模型则更适合保持注入内容精简的检索方式。但尚未通过受控实验单独隔离这一因素。

记忆应校准,而不只是积累

应该给智能体的是它真正能用上的经验量。

  • 较弱模型需要精简核心加少量任务专属经验,恰好也是最便宜的方案。
  • 仍有提升空间的强模型应保留整套指南,并通过提示缓存控制生产成本。
  • 饱和模型在更充分了解剩余失败模式之前,不应增加额外上下文。

收益可由自动流程获得,无需人工标注,也没有测试数据泄漏,但前提是剂量适合模型。

下一步

这只是起点:

  • 学习得到的选择器。 目前检索按余弦相似度排序,但我们已证明它不能完美预测哪条指南会帮助具体任务。由结果信号训练选择器,是自然的下一步。
  • 很弱模型的记忆。 低于最低能力基线时,自我提炼缺乏信号。为很弱模型提供由教师模型提炼的记忆,是我们正在探索的另一个问题。
  • 超越 AppWorld。 本次结果在严格的多步骤基准 AppWorld 上验证,但它终究只有一个基准。更广的智能体基准和真实部署仍在推进。
  • 隔离上下文窗口。 如前所述,我们希望通过受控实验,将窗口大小和原始能力分开。

可以尝试原文链接的 ALTK-Evolve 库,其中包含本研究使用的抽取、整合和检索流程;或阅读完整技术报告,了解方法与消融实验。

附录:指标解释

AppWorld 使用两项指标,均以百分比报告,越高越好。

  • TGC(Task Goal Completion):智能体完整、正确完成的单项任务占比,回答“是否完成工作”。
  • SGC(Scenario Goal Completion):更严格、全有或全无。每个场景含同一任务的多个变体,可能改变数据、措辞或边界条件。只有智能体成功完成每个变体,场景才算通过。它衡量可靠性:经常完成任务、但在某个变体失败的智能体,可以获得 TGC 分数,却不能让该场景获得 SGC 分数。

原文:How Much Memory Does Your Agent Actually Need?,2026年8月18日。作者:Vatche Isahagian、Gaodan Fang、Jayaram Radhakrishnan、Punleuk Oum、Ashwath Vaithinathan Aravindan、Evelyn Duesterwald、G Thomas、Vinod Muthusamy、Merve Unuvar、Ayhan Sebin(IBM Research)。本文为中文译稿,表格数据和实验结论来自原文;原文权利归原权利人所有,转载依据用户明确授权。原文图1及技术报告链接仍需在发布前完整核验。

© 版权声明
THE END
喜欢就支持一下吧
点赞0 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容