根据Perceive Beating 的监测,伊利诺伊大学计算机科学博士生 Dylan Zhang 进行了一项 Agent 记忆实验,结果指向一个反常的结论:让模型反复总结经验,可能会导致其记忆能力下降。
最引人注目的结果之一来自 ARC-AGI:研究人员挑选出 19 道 GPT-5.4 在没有记忆的情况下全部回答正确的问题,然后将这些问题的真实解法输入模型,让其在观看的同时进行“经验总结”。从理论上讲,这相当于开卷考试;然而经过多轮记忆压缩后,同一模型的准确率从 100% 下降到 54%。原始轨迹并没有错误,真正出现问题的是模型在将正确轨迹改写为通用经验时的那一步。
更糟糕的是,这种记忆退化并非个案。在 WebShop 网购任务中,AWM 记忆方法在处理 8 条专家轨迹时的得分为 0.64,在增加到 128 条轨迹后下降到 0.20,恰好回到无记忆的基准线。换句话说,随着记忆堆积,收益反而被抵消了。
问题不在于“经验不足”,而在于“总结过于频繁”。大型模型所记录的经验并不是客观记录,每次总结都是一种重新生成。最终,具体的前提条件将被删除,不同任务的规则将被混合在一起,原本可以指导操作的细节将变成看似正确但实际上毫无用处的废话,例如“优先采取最直接的行动”或“使用正确的工具”。原文展示了一个极端例子,将 50 条结构化记忆合并为 1 条,将多个任务的不同之处压缩为相同的通用流程,导致下一轮评估直接丢失了 6 到 13 个成功样本。
作者提出了一些建议:不要急着让 Agent 每轮都记录“错题本”。更稳妥的做法是保留经过筛选的原始操作轨迹,只在确实需要时进行抽象总结。实验表明,只保留原始 episode 并关闭抽象总结的方案,在多个 Agent 基准上与经过测试的压缩式记忆方法持平甚至超过。对于开发者来说,这个结论非常明确:向模型展示实际操作经历通常比让其背诵一大堆抽象规则更为有效。