给 LLM Agent 加「记忆」是当下提升决策能力的常见做法,但上海 AI Lab 团队指出一个被忽视的问题:历史经验只有在适配当前上下文时才真正有用。多数记忆增强 Agent 把检索到的经验当静态记录直接注入上下文,很少判断这些经验适不适合当下——旧经验与当前状态不匹配时,反而会干扰决策,造成负迁移。
MemHarness 的思路:像人一样重构记忆。人类调用记忆很灵活:先结合当前上下文判断过往经验怎么用,再决定如何服务于当下。受此启发,团队提出「经验重构」框架 MemHarness——在检索与动作之间显式插入「批判」与「重构」两个环节,主动改造检索到的经验,把记忆从静态提示片段变成具有上下文敏感性的指导信息,历史记忆只保留可迁移的部分。
端到端训练,无需人工标注。整套「检索—重构—行动」流程采用 GRPO 进行端到端优化,优化信号来自任务奖励和格式约束;GRPO 会比较同一任务下多条轨迹的表现,思考、重构与动作生成可同时训练,不需要单独的价值网络,也不需要人工标注「记忆该怎么改写」。训练中,Agent 会把交互轨迹中的经验逐步存入记忆库,每次只取最相关的三条作为参考。
实验结果:团队在 ALFWorld 和 WebShop 两个 Agent 决策基准上评估,MemHarness 持续优于纯 RL 基线以及 SOTA 静态记忆增强方法;即便模型规模只有 7B,表现也超过了 Gemini-2.5-Pro 等更大的闭源模型。消融实验证实,去掉重构阶段后性能退化到与朴素记忆重放相当的水平——自适应重构而非单纯检索,才是性能提升的主要驱动。在 OOD(分布外)场景中,MemHarness 会先判断记忆是否适用、改写或舍弃不匹配内容,展现出很强的鲁棒性。
局限与展望:目前方法仅在 ALFWorld 和 WebShop 两个交互式基准上验证,尚未覆盖更开放的真实环境;冷启动时模型任务表现有限,真正的重建与决策能力仍依赖后续任务级强化学习。论文已公开在 arXiv,感兴趣可以细读。
论文:

